Back to Leaderboard

AI Agent Capability

Autonomous agent benchmarks: τ²-Bench, Terminal Bench Hard, Aider-Polyglot.

About Benchmarks

τ²-Bench
自律エージェントタスク — ツール呼び出しと推論の組み合わせ能力を測定
Terminal Bench Hard
ターミナルベースのエージェントタスク — CLI環境での自律的能力を測定
Aider-Polyglot
多言語コーディングアシスタントベンチマーク — 複数プログラミング言語のコーディング能力を測定