AA Long Context Reasoning v1.1 Cost Efficiency
Source-matched reasoning-effort score and task-cost configurations. Each line is one canonical model. Color = provider.
AA Long Context Reasoning v1.1 Cost Efficiency
AA Long Context Reasoning v1.1 Cost Efficiency
Source-matched reasoning-effort score and task-cost configurations. Each line is one canonical model. Color = provider.
How to read this chart
Each line uses the shared model-configuration dataset to compare source-matched reasoning-effort levels on AA Long Context Reasoning v1.1. Every point shows the score and AA cost per task for that exact configuration. Canonical score bars and bell curves remain one point per model.
Data sources
More / ExperimentalAA Long Context Reasoning v1.1 vs Effective CostX = effective cost (log). Y = AA Long Context Reasoning v1.1. Exact AA v4.3.2 model/configuration; never substitute older benchmark versions.Data: Artificial Analysis, ARC Prize, Vals Index v2 Cost per Test +1 moreOpen chartIQ BenchmarksAA Long Context Reasoning v1.1 ScoresExact AA v4.3.2 model/configuration; never substitute older benchmark versions. Contributes to Reliability using a provisional calibrated scale.Data: Artificial AnalysisOpen chartMore / ExperimentalSWE-Bench Verified Benchmark ScoresHistorical data. Vals archived cohort; retired from default Software Engineering domain. Each model's SWE-Bench Verified score. Color = provider.Data: Vals.ai, LLM StatsOpen chartMore / ExperimentalTerminal-Bench 2.0 Benchmark ScoresHistorical data. Superseded by 2.1 and 4.0. Legacy Terminal-Bench 2.0 scores retained for historical comparison. Color = provider.Data: Terminal-BenchOpen chartMore / ExperimentalTerminal-Bench 2.1 Benchmark ScoresHistorical data. Superseded in Programmatic Reasoning by Terminal-Bench 4.0. Each model's Terminal-Bench 2.1 pass@1 score, using Artificial Analysis as canonical and Vals.ai as fallback. Color = provider.Data: Artificial Analysis Terminal-Bench v2.1, Vals.ai Terminal-Bench 2.1, Artificial Analysis Intelligence Index v4.3.1Open chartMore / ExperimentalTerminal-Bench Hard Benchmark ScoresHistorical data. Historical hard subset; not a Terminal-Bench 4.0 result. Each model's Terminal-Bench Hard score. Color = provider.Data: Artificial AnalysisOpen chart