Displaying 1 to 27 of 27 repositories
Procedurally-generated terminal-agent benchmark. Use via affine-cortex 'af eval --env terminal'.
2m
6.6K
MemoryGym: affent-based memory evaluation environment for af eval.
3m
3.7K
Affine agent eval env for Chinese travel planning with real MCP tools (AMap + Transport).
3m
3.8K
The environment evaluates language models on logical reasoning tasks
8m
2.4K
he Code (CDE) environment evaluates language models on code generation tasks
8m
2.0K
The Affine environment provides three types of reasoning tasks for evaluating language models
10m
1.2K
The AgentGym environment provides interactive agent evaluation across multiple benchmark tasks.
10m
2.5K