Terminal-Bench 4.0 Cost Efficiency
Source-matched reasoning-effort score and task-cost configurations. Each line is one canonical model. Color = provider.
Terminal-Bench 4.0 Cost Efficiency
Terminal-Bench 4.0 Cost Efficiency
Source-matched reasoning-effort score and task-cost configurations. Each line is one canonical model. Color = provider.
How to read this chart
Each line uses the shared model-configuration dataset to compare source-matched reasoning-effort levels on Terminal-Bench 4.0. Every point shows the score and AA cost per task for that exact configuration. Canonical score bars and bell curves remain one point per model.
Data sources
More / ExperimentalTerminal-Bench 4.0 vs Effective CostX = effective cost (log). Y = Terminal-Bench 4.0. Exact AA v4.3.2 model/configuration; never substitute older benchmark versions.Data: Artificial Analysis, ARC Prize, Vals Index v2 Cost per Test +1 moreOpen chartIQ BenchmarksTerminal-Bench 4.0 ScoresExact AA v4.3.2 model/configuration; never substitute older benchmark versions. Contributes to Programmatic Reasoning using a provisional calibrated scale.Data: Artificial AnalysisOpen chartMore / ExperimentalSWE-Bench Verified Benchmark ScoresHistorical data. Vals archived cohort; retired from default Software Engineering domain. Each model's SWE-Bench Verified score. Color = provider.Data: Vals.ai, LLM StatsOpen chartMore / ExperimentalTerminal-Bench 2.0 Benchmark ScoresHistorical data. Superseded by 2.1 and 4.0. Legacy Terminal-Bench 2.0 scores retained for historical comparison. Color = provider.Data: Terminal-BenchOpen chartMore / ExperimentalTerminal-Bench 2.1 Benchmark ScoresHistorical data. Superseded in Programmatic Reasoning by Terminal-Bench 4.0. Each model's Terminal-Bench 2.1 pass@1 score, using Artificial Analysis as canonical and Vals.ai as fallback. Color = provider.Data: Artificial Analysis Terminal-Bench v2.1, Vals.ai Terminal-Bench 2.1, Artificial Analysis Intelligence Index v4.3.1Open chartMore / ExperimentalTerminal-Bench Hard Benchmark ScoresHistorical data. Historical hard subset; not a Terminal-Bench 4.0 result. Each model's Terminal-Bench Hard score. Color = provider.Data: Artificial AnalysisOpen chart