Displaying 1 to 27 of 27 repositories
Procedurally-generated terminal-agent benchmark. Use via affine-cortex 'af eval --env terminal'.
2m
6.4K
MemoryGym: affent-based memory evaluation environment for af eval.
2m
3.6K
Affine agent eval env for Chinese travel planning with real MCP tools (AMap + Transport).
3m
3.8K
The environment evaluates language models on logical reasoning tasks
7m
2.4K
he Code (CDE) environment evaluates language models on code generation tasks
8m
2.0K
The Affine environment provides three types of reasoning tasks for evaluating language models
9m
1.1K
The AgentGym environment provides interactive agent evaluation across multiple benchmark tasks.
10m
2.5K