Reliability IQ Rankings
Each model's estimated Reliability IQ, ranked highest to lowest. Defaults to current-generation models.
Reliability IQ Rankings
More / ExperimentalReliability IQ vs CostEach model's estimated Reliability IQ against its effective cost per 1M I/O Tokens (sticker price × measured or imputed usage multiplier).Data: Artificial Analysis, ARC Prize, Vals Index v2 Cost per Test +6 moreOpen chartCoreIQ Bell CurveEach model's estimated IQ, placed on a standard normal IQ distribution.Data: ARC Prize, Epoch AI FrontierMath, ProofBench 1.1 +21 moreOpen chartIQ BenchmarksAA Omniscience ScoresArtificial Analysis Omniscience scores for factual reliability. Color = provider.Data: Artificial AnalysisOpen chartIQ BenchmarksAA Long Context Reasoning v1.1 ScoresExact AA v4.3.2 model/configuration; never substitute older benchmark versions. Contributes to Reliability using a provisional calibrated scale.Data: Artificial AnalysisOpen chartIQ BenchmarksIFBench Benchmark ScoresInstruction-following and constraint-adherence scores. Color = provider.Data: Artificial Analysis, Artificial Analysis Intelligence Index v4.3.2Open chartIQ BenchmarksBullshitBench v2 ScoresClear Pushback rate: share of attempts where a model clearly challenges a false premise instead of accepting nonsense. Color = provider.Data: BullshitBench v2Open chartIQ BenchmarksSimpleQA Verified ScoresCorrect-answer rate on Epoch AI's verified factuality set. Color = provider.Data: Epoch AI SimpleQA VerifiedOpen chart