{
  "apiVersion": "1",
  "methodologyVersion": "2026-07-09-gso-ml-domain",
  "updatedAt": "2026-07-16T22:13:02.394Z",
  "id": "gpt-5.5",
  "name": "gpt-5.5",
  "provider": "OpenAI",
  "country": "United States",
  "rank": 4,
  "iq": 129,
  "dimensions": {
    "abstract-reasoning": {
      "iq": 108,
      "benchmarksCovered": 3,
      "benchmarksTotal": 3,
      "imputed": false
    },
    "mathematical-reasoning": {
      "iq": 141,
      "benchmarksCovered": 4,
      "benchmarksTotal": 5,
      "imputed": false
    },
    "scientific-reasoning": {
      "iq": 142,
      "benchmarksCovered": 4,
      "benchmarksTotal": 4,
      "imputed": false
    },
    "frontend-engineering": {
      "iq": 125,
      "benchmarksCovered": 4,
      "benchmarksTotal": 4,
      "imputed": false
    },
    "backend-engineering": {
      "iq": 136,
      "benchmarksCovered": 8,
      "benchmarksTotal": 9,
      "imputed": false
    },
    "computer-use": {
      "iq": 135,
      "benchmarksCovered": 7,
      "benchmarksTotal": 7,
      "imputed": false
    },
    "reliability": {
      "iq": 119,
      "benchmarksCovered": 5,
      "benchmarksTotal": 5,
      "imputed": false
    }
  },
  "emotionalReasoning": 118,
  "cost": {
    "inputPer1M": 5,
    "outputPer1M": 30,
    "cacheReadPer1M": 0.5,
    "cacheWritePer1M": null,
    "cacheWrite1hPer1M": null,
    "cacheStorageHourlyPer1M": null,
    "ioPer1M": 35,
    "usageMultiplier": 0.974,
    "usageMultiplierSource": "measured",
    "effectivePer1M": 34.0775,
    "unit": "USD per 1M I/O Tokens"
  },
  "speed": {
    "responseTimeSec": 91.51,
    "medianTokensPerSecond": 81
  },
  "parametersB": null,
  "contextWindow": 922000,
  "releaseDate": "2026-04-23",
  "openSource": false,
  "url": "https://www.aiiq.org/models/gpt-5.5/",
  "benchmarkResults": {
    "aa-lcr": {
      "value": 74,
      "field": "aaLCR",
      "name": "AA Long Chain Reasoning",
      "category": "iq",
      "dimension": "reliability",
      "direction": "higher_is_better"
    },
    "aa-omniscience": {
      "value": 20,
      "field": "aaOmniscience",
      "name": "AA Omniscience",
      "category": "iq",
      "dimension": "reliability",
      "direction": "higher_is_better"
    },
    "agents-last-exam": {
      "value": 24,
      "field": "agentsLastExam",
      "name": "Agents' Last Exam",
      "category": "iq",
      "dimension": "computer-use",
      "direction": "higher_is_better"
    },
    "apex-swe": {
      "value": 40.8,
      "field": "apexSWE",
      "name": "APEX-SWE",
      "category": "iq",
      "dimension": "backend-engineering",
      "direction": "higher_is_better"
    },
    "arc-agi-1": {
      "value": 95,
      "field": "arcAgi1",
      "name": "ARC-AGI-1",
      "category": "iq",
      "dimension": "abstract-reasoning",
      "direction": "higher_is_better"
    },
    "arc-agi-2": {
      "value": 85,
      "field": "arcAgi2",
      "name": "ARC-AGI-2",
      "category": "iq",
      "dimension": "abstract-reasoning",
      "direction": "higher_is_better"
    },
    "arc-agi-3": {
      "value": 0.4,
      "field": "arcAgi3",
      "name": "ARC-AGI-3",
      "category": "iq",
      "dimension": "abstract-reasoning",
      "direction": "higher_is_better"
    },
    "arena-score": {
      "value": 1475,
      "field": "arenaScore",
      "name": "Arena.ai Overall",
      "category": "eq",
      "dimension": null,
      "direction": "higher_is_better"
    },
    "attunebench-composite": {
      "value": 53.7,
      "field": "attuneComposite",
      "name": "AttuneBench Composite",
      "category": "eq",
      "dimension": null,
      "direction": "higher_is_better"
    },
    "browsecomp": {
      "value": 84.4,
      "field": "browseComp",
      "name": "BrowseComp",
      "category": "iq",
      "dimension": "computer-use",
      "direction": "higher_is_better"
    },
    "bullshitbench-v2": {
      "value": 47,
      "field": "bullshitBench",
      "name": "BullshitBench v2",
      "category": "iq",
      "dimension": "reliability",
      "direction": "higher_is_better"
    },
    "critpt": {
      "value": 27,
      "field": "critPt",
      "name": "CritPt",
      "category": "iq",
      "dimension": "scientific-reasoning",
      "direction": "higher_is_better"
    },
    "deepswe-v1-1": {
      "value": 67.04,
      "field": "deepSWEV11",
      "name": "DeepSWE v1.1",
      "category": "iq",
      "dimension": "backend-engineering",
      "direction": "higher_is_better"
    },
    "deepswe": {
      "value": 70.05,
      "field": "deepSWE",
      "name": "DeepSWE",
      "category": "iq",
      "dimension": "backend-engineering",
      "direction": "higher_is_better"
    },
    "designarena-frontend": {
      "value": 1193,
      "field": "designArenaFrontend",
      "name": "DesignArena Frontend",
      "category": "iq",
      "dimension": "frontend-engineering",
      "direction": "higher_is_better"
    },
    "designarena-fullstack": {
      "value": 1173,
      "field": "designArenaFullstack",
      "name": "DesignArena Full Stack",
      "category": "iq",
      "dimension": "frontend-engineering",
      "direction": "higher_is_better"
    },
    "eq-bench-3-elo": {
      "value": 1590.6,
      "field": "eqBenchElo",
      "name": "EQ-Bench 3 Elo",
      "category": "eq",
      "dimension": null,
      "direction": "higher_is_better"
    },
    "facts-grounding": {
      "value": 75.9,
      "field": "factsGrounding",
      "name": "FACTS Grounding",
      "category": "iq",
      "dimension": "reliability",
      "direction": "higher_is_better"
    },
    "frontiercode-diamond": {
      "value": 6.3,
      "field": "frontierCodeDiamond",
      "name": "FrontierCode Diamond",
      "category": "iq",
      "dimension": "backend-engineering",
      "direction": "higher_is_better"
    },
    "frontiermath-t13": {
      "value": 85.3,
      "field": "fmT13Acc",
      "name": "FrontierMath Tier 1-3",
      "category": "iq",
      "dimension": "mathematical-reasoning",
      "direction": "higher_is_better"
    },
    "frontiermath-t4": {
      "value": 72.5,
      "field": "fmT4Acc",
      "name": "FrontierMath Tier 4",
      "category": "iq",
      "dimension": "mathematical-reasoning",
      "direction": "higher_is_better"
    },
    "frontierswe": {
      "value": 73,
      "field": "frontierSWE",
      "name": "FrontierSWE",
      "category": "iq",
      "dimension": "backend-engineering",
      "direction": "higher_is_better"
    },
    "gpqa-diamond": {
      "value": 94,
      "field": "gpqa",
      "name": "GPQA Diamond",
      "category": "iq",
      "dimension": "scientific-reasoning",
      "direction": "higher_is_better"
    },
    "humanitys-last-exam": {
      "value": 44,
      "field": "hle",
      "name": "Humanity's Last Exam",
      "category": "iq",
      "dimension": "scientific-reasoning",
      "direction": "higher_is_better"
    },
    "ifbench": {
      "value": 76,
      "field": "ifBench",
      "name": "IFBench",
      "category": "iq",
      "dimension": "reliability",
      "direction": "higher_is_better"
    },
    "livecodebench": {
      "value": 85.3,
      "field": "livecodebench",
      "name": "LiveCodeBench",
      "category": "iq",
      "dimension": "backend-engineering",
      "direction": "higher_is_better"
    },
    "matharena": {
      "value": 83,
      "field": "mathArena",
      "name": "MathArena",
      "category": "iq",
      "dimension": "mathematical-reasoning",
      "direction": "higher_is_better"
    },
    "mcp-atlas": {
      "value": 75.3,
      "field": "mcpAtlas",
      "name": "MCP Atlas",
      "category": "iq",
      "dimension": "computer-use",
      "direction": "higher_is_better"
    },
    "osworld-verified": {
      "value": 78.7,
      "field": "osworldVerified",
      "name": "OSWorld-Verified",
      "category": "iq",
      "dimension": "computer-use",
      "direction": "higher_is_better"
    },
    "proofbench": {
      "value": 50,
      "field": "proofbench",
      "name": "ProofBench",
      "category": "iq",
      "dimension": "mathematical-reasoning",
      "direction": "higher_is_better"
    },
    "scicode": {
      "value": 56,
      "field": "sciCode",
      "name": "SciCode",
      "category": "iq",
      "dimension": "scientific-reasoning",
      "direction": "higher_is_better"
    },
    "swe-marathon": {
      "value": 12,
      "field": "sweMarathon",
      "name": "SWE Marathon",
      "category": "iq",
      "dimension": "backend-engineering",
      "direction": "higher_is_better"
    },
    "swe-rebench": {
      "value": 62.7,
      "field": "sweRebench",
      "name": "SWE-rebench",
      "category": "iq",
      "dimension": "backend-engineering",
      "direction": "higher_is_better"
    },
    "swebench-verified": {
      "value": 82.6,
      "field": "swebench",
      "name": "SWE-Bench Verified",
      "category": "iq",
      "dimension": "backend-engineering",
      "direction": "higher_is_better"
    },
    "terminal-bench-2-1": {
      "value": 84,
      "field": "terminalbench21",
      "name": "Terminal-Bench 2.1",
      "category": "iq",
      "dimension": "computer-use",
      "direction": "higher_is_better"
    },
    "terminal-bench-hard": {
      "value": 61,
      "field": "terminalbenchHard",
      "name": "Terminal-Bench Hard",
      "category": "iq",
      "dimension": "computer-use",
      "direction": "higher_is_better"
    },
    "toolathlon": {
      "value": 55.6,
      "field": "toolathlon",
      "name": "Toolathlon",
      "category": "iq",
      "dimension": "computer-use",
      "direction": "higher_is_better"
    },
    "vibe-code-bench": {
      "value": 69.847,
      "field": "vibeCodeBench",
      "name": "Vibe Code Bench",
      "category": "iq",
      "dimension": "frontend-engineering",
      "direction": "higher_is_better"
    },
    "webdev-code-arena": {
      "value": 1502,
      "field": "webdevCodeArena",
      "name": "Arena.ai WebDev",
      "category": "iq",
      "dimension": "frontend-engineering",
      "direction": "higher_is_better"
    }
  }
}
