Benchmarks
Every source-backed benchmark, grouped by cognitive dimension — open any chart for its detail and cost view
Abstract Reasoning
IQ BenchmarksARC-AGI-2 ScoresEach model's ARC-AGI-2 score. Color = provider.Data: ARC PrizeOpen chartIQ BenchmarksARC-AGI-1 Benchmark ScoresEach model's ARC-AGI-1 score. Color = provider.Data: ARC PrizeOpen chartIQ BenchmarksARC-AGI-3 Benchmark ScoresEach model's ARC-AGI-3 score. Color = provider.Data: ARC PrizeOpen chart
Mathematical Reasoning
IQ BenchmarksAIME Benchmark ScoresEach model's AIME score. Color = provider.Data: Vals.ai, Artificial AnalysisOpen chartIQ BenchmarksFrontierMath Tier 1-3 Benchmark ScoresEach model's FrontierMath Tier 1-3 score. Color = provider.Data: Epoch AI FrontierMathOpen chartIQ BenchmarksFrontierMath Tier 4 Benchmark ScoresEach model's FrontierMath Tier 4 score. Color = provider.Data: Epoch AI FrontierMathOpen chartIQ BenchmarksMathArena Benchmark ScoresEach model's MathArena expected performance. Color = provider.Data: MathArenaOpen chartIQ BenchmarksProofBench Benchmark ScoresEach model's ProofBench score. Color = provider.Data: Vals.aiOpen chart
Academic Reasoning
IQ BenchmarksHumanity's Last Exam Benchmark ScoresEach model's Humanity's Last Exam score. Color = provider.Data: Artificial AnalysisOpen chartIQ BenchmarksGPQA Diamond Benchmark ScoresEach model's GPQA Diamond score. Color = provider.Data: Artificial AnalysisOpen chartIQ BenchmarksSciCode Benchmark ScoresEach model's SciCode score. Color = provider.Data: Artificial AnalysisOpen chartIQ BenchmarksCritPt Benchmark ScoresEach model's CritPt percentage score. Color = provider.Data: Artificial AnalysisOpen chartIQ BenchmarksMMMU-Pro Benchmark ScoresEach model's MMMU-Pro score. Color = provider.Data: Artificial Analysis, Artificial Analysis model leaderboardOpen chartIQ BenchmarksMMLU-Pro Benchmark ScoresEach model's MMLU-Pro score. Color = provider.Data: Manual source capture, vals-model-pageOpen chart
Programmatic Reasoning
IQ BenchmarksTerminal-Bench 2.1 Benchmark ScoresEach model's Terminal-Bench 2.1 pass@1 score, using Artificial Analysis as canonical and Vals.ai as fallback. Color = provider.Data: Artificial Analysis Terminal-Bench v2.1, Vals.ai Terminal-Bench 2.1Open chartIQ BenchmarksLiveCodeBench Benchmark ScoresEach model's LiveCodeBench score. Color = provider.Data: Vals.aiOpen chartIQ BenchmarksProgramBench ScoresAlmost Resolved score: share of ProgramBench tasks passing at least 95% of hidden tests. Color = provider.Data: Vals.ai ProgramBenchOpen chartIQ BenchmarksIOI Benchmark ScoresVals.ai accuracy across the 2024 and 2025 International Olympiad in Informatics tasks. Color = provider.Data: Vals.ai IOIOpen chartIQ BenchmarksSWE-rebench Benchmark ScoresEach model's SWE-rebench resolved rate. Color = provider.Data: SWE-rebenchOpen chartIQ BenchmarksFrontierSWE ScoresFrontierSWE leaderboard tracking for software-engineering skill at the edge of human ability. Color = provider.Data: FrontierSWEOpen chart
Computer Use
IQ BenchmarksBrowseComp Benchmark ScoresEach model's BrowseComp score. Color = provider.Data: LLM StatsOpen chartIQ BenchmarksMCP Atlas Benchmark ScoresReal-world MCP tool-use pass rates. Color = provider.Data: Scale Labs, Scale Labs MCP AtlasOpen chartIQ BenchmarksArena.ai Agent Arena ScoresAggregate net improvement across real-world Agent Mode sessions. Color = provider.Data: Arena.ai Agent ArenaOpen chartIQ BenchmarksToolathlon Benchmark ScoresEach model's Toolathlon score. Color = provider.Data: LLM Stats, Toolathlon, LLM Stats ToolathlonOpen chartIQ BenchmarksAgents' Last Exam Benchmark ScoresFull / Overall pass rates from Agents' Last Exam. Color = provider.Data: Agents' Last ExamOpen chartIQ BenchmarksOSWorld-Verified Benchmark ScoresEach model's OSWorld-Verified score. Color = provider.Data: LLM Stats, OSWorld, LLM Stats OSWorld-VerifiedOpen chart
Reliability
IQ BenchmarksAA Long Chain Reasoning ScoresArtificial Analysis Long Chain Reasoning scores for long-document extraction, synthesis, and reasoning. Color = provider.Data: Artificial AnalysisOpen chartIQ BenchmarksAA Omniscience ScoresArtificial Analysis Omniscience scores for factual reliability. Color = provider.Data: Artificial AnalysisOpen chartIQ BenchmarksIFBench Benchmark ScoresInstruction-following and constraint-adherence scores. Color = provider.Data: Artificial AnalysisOpen chartIQ BenchmarksBullshitBench v2 ScoresClear Pushback rate: share of attempts where a model clearly challenges a false premise instead of accepting nonsense. Color = provider.Data: BullshitBench v2Open chartIQ BenchmarksSimpleQA Verified ScoresCorrect-answer rate on Epoch AI's verified factuality set. Color = provider.Data: Epoch AI SimpleQA VerifiedOpen chartIQ BenchmarksFACTS Grounding ScoresGoogle FACTS Grounding scores for long-form responses fully grounded in provided documents. Color = provider.Data: Kaggle FACTS Grounding leaderboardOpen chartIQ BenchmarksMultiChallenge ScoresMulti-turn instruction retention, inference memory, editing, and self-coherence performance. Color = provider.Data: Scale Labs MultiChallengeOpen chart