리더보드로 돌아가기

종합 랭킹

HLE, ARC-AGI-2, FrontierMath, SWE-bench Verified, τ²-Bench 기반 종합 AI 모델 순위.

벤치마크 소개

HLE
総合知能テスト — 人間レベルの推論能力を測定
ARC-AGI-2
抽象的推論ベンチマーク — 新規パターンの汎化能力を測定
FrontierMath - Tier 4
高度な数学問題 — 研究レベルの数学的推論能力を測定
SWE-bench Verified
実践的ソフトウェア開発タスク — 実際のバグ修正能力を測定
τ²-Bench
自律エージェントタスク — ツール呼び出しと推論の組み合わせ能力を測定