{
  "apiVersion": "1",
  "methodologyVersion": "2026-07-24-arc-coverage-stability",
  "updatedAt": "2026-08-29T04:03:36.377Z",
  "rankings": [
    {
      "id": "composite-iq",
      "rankingName": "Composite IQ",
      "rankingType": "derived",
      "dimension": null,
      "direction": "higher_is_better",
      "modelCount": 118,
      "url": "https://www.aiiq.org/api/rankings/composite-iq"
    },
    {
      "id": "effective-cost",
      "rankingName": "Effective Cost",
      "rankingType": "derived",
      "dimension": null,
      "direction": "lower_is_better",
      "modelCount": 112,
      "url": "https://www.aiiq.org/api/rankings/effective-cost"
    },
    {
      "id": "abstract-reasoning-iq",
      "rankingName": "Abstract Reasoning IQ",
      "rankingType": "dimension",
      "dimension": "abstract-reasoning",
      "direction": "higher_is_better",
      "modelCount": 125,
      "url": "https://www.aiiq.org/api/rankings/abstract-reasoning-iq"
    },
    {
      "id": "mathematical-reasoning-iq",
      "rankingName": "Mathematical Reasoning IQ",
      "rankingType": "dimension",
      "dimension": "mathematical-reasoning",
      "direction": "higher_is_better",
      "modelCount": 126,
      "url": "https://www.aiiq.org/api/rankings/mathematical-reasoning-iq"
    },
    {
      "id": "academic-reasoning-iq",
      "rankingName": "Academic Reasoning IQ",
      "rankingType": "dimension",
      "dimension": "academic-reasoning",
      "direction": "higher_is_better",
      "modelCount": 126,
      "url": "https://www.aiiq.org/api/rankings/academic-reasoning-iq"
    },
    {
      "id": "programmatic-reasoning-iq",
      "rankingName": "Programmatic Reasoning IQ",
      "rankingType": "dimension",
      "dimension": "programmatic-reasoning",
      "direction": "higher_is_better",
      "modelCount": 120,
      "url": "https://www.aiiq.org/api/rankings/programmatic-reasoning-iq"
    },
    {
      "id": "computer-use-iq",
      "rankingName": "Computer Use IQ",
      "rankingType": "dimension",
      "dimension": "computer-use",
      "direction": "higher_is_better",
      "modelCount": 118,
      "url": "https://www.aiiq.org/api/rankings/computer-use-iq"
    },
    {
      "id": "reliability-iq",
      "rankingName": "Reliability IQ",
      "rankingType": "dimension",
      "dimension": "reliability",
      "direction": "higher_is_better",
      "modelCount": 121,
      "url": "https://www.aiiq.org/api/rankings/reliability-iq"
    },
    {
      "id": "aa-lcr",
      "rankingName": "AA Long Chain Reasoning",
      "rankingType": "benchmark",
      "dimension": "reliability",
      "direction": "higher_is_better",
      "modelCount": 101,
      "url": "https://www.aiiq.org/api/rankings/aa-lcr"
    },
    {
      "id": "aa-omniscience",
      "rankingName": "AA Omniscience",
      "rankingType": "benchmark",
      "dimension": "reliability",
      "direction": "higher_is_better",
      "modelCount": 99,
      "url": "https://www.aiiq.org/api/rankings/aa-omniscience"
    },
    {
      "id": "agent-arena",
      "rankingName": "Arena.ai Agent Arena",
      "rankingType": "benchmark",
      "dimension": "computer-use",
      "direction": "higher_is_better",
      "modelCount": 25,
      "url": "https://www.aiiq.org/api/rankings/agent-arena"
    },
    {
      "id": "agents-last-exam",
      "rankingName": "Agents' Last Exam",
      "rankingType": "benchmark",
      "dimension": "computer-use",
      "direction": "higher_is_better",
      "modelCount": 20,
      "url": "https://www.aiiq.org/api/rankings/agents-last-exam"
    },
    {
      "id": "aime",
      "rankingName": "AIME",
      "rankingType": "benchmark",
      "dimension": "mathematical-reasoning",
      "direction": "higher_is_better",
      "modelCount": 53,
      "url": "https://www.aiiq.org/api/rankings/aime"
    },
    {
      "id": "arc-agi-1",
      "rankingName": "ARC-AGI-1",
      "rankingType": "benchmark",
      "dimension": "abstract-reasoning",
      "direction": "higher_is_better",
      "modelCount": 47,
      "url": "https://www.aiiq.org/api/rankings/arc-agi-1"
    },
    {
      "id": "arc-agi-2",
      "rankingName": "ARC-AGI-2",
      "rankingType": "benchmark",
      "dimension": "abstract-reasoning",
      "direction": "higher_is_better",
      "modelCount": 47,
      "url": "https://www.aiiq.org/api/rankings/arc-agi-2"
    },
    {
      "id": "arc-agi-3",
      "rankingName": "ARC-AGI-3",
      "rankingType": "benchmark",
      "dimension": "abstract-reasoning",
      "direction": "higher_is_better",
      "modelCount": 13,
      "url": "https://www.aiiq.org/api/rankings/arc-agi-3"
    },
    {
      "id": "browsecomp",
      "rankingName": "BrowseComp",
      "rankingType": "benchmark",
      "dimension": "computer-use",
      "direction": "higher_is_better",
      "modelCount": 31,
      "url": "https://www.aiiq.org/api/rankings/browsecomp"
    },
    {
      "id": "bullshitbench-v2",
      "rankingName": "BullshitBench v2",
      "rankingType": "benchmark",
      "dimension": "reliability",
      "direction": "higher_is_better",
      "modelCount": 57,
      "url": "https://www.aiiq.org/api/rankings/bullshitbench-v2"
    },
    {
      "id": "critpt",
      "rankingName": "CritPt",
      "rankingType": "benchmark",
      "dimension": "academic-reasoning",
      "direction": "higher_is_better",
      "modelCount": 102,
      "url": "https://www.aiiq.org/api/rankings/critpt"
    },
    {
      "id": "facts-grounding",
      "rankingName": "FACTS Grounding",
      "rankingType": "benchmark",
      "dimension": "reliability",
      "direction": "higher_is_better",
      "modelCount": 24,
      "url": "https://www.aiiq.org/api/rankings/facts-grounding"
    },
    {
      "id": "frontiermath-t13",
      "rankingName": "FrontierMath Tier 1-3",
      "rankingType": "benchmark",
      "dimension": "mathematical-reasoning",
      "direction": "higher_is_better",
      "modelCount": 47,
      "url": "https://www.aiiq.org/api/rankings/frontiermath-t13"
    },
    {
      "id": "frontiermath-t4",
      "rankingName": "FrontierMath Tier 4",
      "rankingType": "benchmark",
      "dimension": "mathematical-reasoning",
      "direction": "higher_is_better",
      "modelCount": 44,
      "url": "https://www.aiiq.org/api/rankings/frontiermath-t4"
    },
    {
      "id": "frontierswe",
      "rankingName": "FrontierSWE",
      "rankingType": "benchmark",
      "dimension": "programmatic-reasoning",
      "direction": "higher_is_better",
      "modelCount": 14,
      "url": "https://www.aiiq.org/api/rankings/frontierswe"
    },
    {
      "id": "gpqa-diamond",
      "rankingName": "GPQA Diamond",
      "rankingType": "benchmark",
      "dimension": "academic-reasoning",
      "direction": "higher_is_better",
      "modelCount": 112,
      "url": "https://www.aiiq.org/api/rankings/gpqa-diamond"
    },
    {
      "id": "humanitys-last-exam",
      "rankingName": "Humanity's Last Exam",
      "rankingType": "benchmark",
      "dimension": "academic-reasoning",
      "direction": "higher_is_better",
      "modelCount": 112,
      "url": "https://www.aiiq.org/api/rankings/humanitys-last-exam"
    },
    {
      "id": "ifbench",
      "rankingName": "IFBench",
      "rankingType": "benchmark",
      "dimension": "reliability",
      "direction": "higher_is_better",
      "modelCount": 88,
      "url": "https://www.aiiq.org/api/rankings/ifbench"
    },
    {
      "id": "ioi",
      "rankingName": "IOI",
      "rankingType": "benchmark",
      "dimension": "programmatic-reasoning",
      "direction": "higher_is_better",
      "modelCount": 24,
      "url": "https://www.aiiq.org/api/rankings/ioi"
    },
    {
      "id": "livecodebench",
      "rankingName": "LiveCodeBench",
      "rankingType": "benchmark",
      "dimension": "programmatic-reasoning",
      "direction": "higher_is_better",
      "modelCount": 54,
      "url": "https://www.aiiq.org/api/rankings/livecodebench"
    },
    {
      "id": "matharena",
      "rankingName": "MathArena",
      "rankingType": "benchmark",
      "dimension": "mathematical-reasoning",
      "direction": "higher_is_better",
      "modelCount": 40,
      "url": "https://www.aiiq.org/api/rankings/matharena"
    },
    {
      "id": "mcp-atlas",
      "rankingName": "MCP Atlas",
      "rankingType": "benchmark",
      "dimension": "computer-use",
      "direction": "higher_is_better",
      "modelCount": 24,
      "url": "https://www.aiiq.org/api/rankings/mcp-atlas"
    },
    {
      "id": "mmlu-pro",
      "rankingName": "MMLU-Pro",
      "rankingType": "benchmark",
      "dimension": "academic-reasoning",
      "direction": "higher_is_better",
      "modelCount": 28,
      "url": "https://www.aiiq.org/api/rankings/mmlu-pro"
    },
    {
      "id": "mmmu-pro",
      "rankingName": "MMMU-Pro",
      "rankingType": "benchmark",
      "dimension": "academic-reasoning",
      "direction": "higher_is_better",
      "modelCount": 62,
      "url": "https://www.aiiq.org/api/rankings/mmmu-pro"
    },
    {
      "id": "multichallenge",
      "rankingName": "MultiChallenge",
      "rankingType": "benchmark",
      "dimension": "reliability",
      "direction": "higher_is_better",
      "modelCount": 18,
      "url": "https://www.aiiq.org/api/rankings/multichallenge"
    },
    {
      "id": "osworld-verified",
      "rankingName": "OSWorld-Verified",
      "rankingType": "benchmark",
      "dimension": "computer-use",
      "direction": "higher_is_better",
      "modelCount": 15,
      "url": "https://www.aiiq.org/api/rankings/osworld-verified"
    },
    {
      "id": "programbench-almost-resolved",
      "rankingName": "ProgramBench",
      "rankingType": "benchmark",
      "dimension": "programmatic-reasoning",
      "direction": "higher_is_better",
      "modelCount": 28,
      "url": "https://www.aiiq.org/api/rankings/programbench-almost-resolved"
    },
    {
      "id": "proofbench",
      "rankingName": "ProofBench",
      "rankingType": "benchmark",
      "dimension": "mathematical-reasoning",
      "direction": "higher_is_better",
      "modelCount": 33,
      "url": "https://www.aiiq.org/api/rankings/proofbench"
    },
    {
      "id": "scicode",
      "rankingName": "SciCode",
      "rankingType": "benchmark",
      "dimension": "academic-reasoning",
      "direction": "higher_is_better",
      "modelCount": 112,
      "url": "https://www.aiiq.org/api/rankings/scicode"
    },
    {
      "id": "simpleqa-verified",
      "rankingName": "SimpleQA Verified",
      "rankingType": "benchmark",
      "dimension": "reliability",
      "direction": "higher_is_better",
      "modelCount": 51,
      "url": "https://www.aiiq.org/api/rankings/simpleqa-verified"
    },
    {
      "id": "swe-rebench",
      "rankingName": "SWE-rebench",
      "rankingType": "benchmark",
      "dimension": "programmatic-reasoning",
      "direction": "higher_is_better",
      "modelCount": 19,
      "url": "https://www.aiiq.org/api/rankings/swe-rebench"
    },
    {
      "id": "terminal-bench-2-1",
      "rankingName": "Terminal-Bench 2.1",
      "rankingType": "benchmark",
      "dimension": "programmatic-reasoning",
      "direction": "higher_is_better",
      "modelCount": 72,
      "url": "https://www.aiiq.org/api/rankings/terminal-bench-2-1"
    },
    {
      "id": "toolathlon",
      "rankingName": "Toolathlon",
      "rankingType": "benchmark",
      "dimension": "computer-use",
      "direction": "higher_is_better",
      "modelCount": 24,
      "url": "https://www.aiiq.org/api/rankings/toolathlon"
    }
  ]
}
