Verdict
Claude Opus 4.6 leads 21–2 across 23 shared benchmarks.
Claude Opus 4.5 2 · Claude Opus 4.6 21 · higher isn't always better — check the caveats below.
Reported scores — protocols may differ. How we compare
Reasoning: Claude Opus 4.6 leads 5–0 across 5 shared reasoning benchmarks (largest gap: ARC-AGI, 94 vs 80 — single evaluator).
Unknown: Claude Opus 4.6 leads 3–1 across 4 shared unknown benchmarks (largest gap: ProofBench, 50 vs 36 — single evaluator).
Agentic: Claude Opus 4.6 leads 3–0 across 3 shared agentic benchmarks (largest gap: APEX-Agents, 32.4 vs 20.7 — protocols undisclosed).
Math: Claude Opus 4.6 leads 2–0 across 2 shared math benchmarks (largest gap: FrontierMath-Tier-4-v2-Private, 26.83 vs 4.88 — single evaluator).
Vendor claims — compare against the measured scores above. A claim is what a developer says about its own model, not an independent measurement.
No vendor claims on file for Claude Opus 4.5.
Coding
“The new Claude Opus 4.6 improves on its predecessor's coding skills”
Claude Opus 4.6 leads 21–2 across 23 shared benchmarks. Claude Opus 4.5 leads 2 benchmarks and Claude Opus 4.6 leads 21. Higher isn't always better — see the integrity caveats on each benchmark.
Claude Opus 4.5 and Claude Opus 4.6 have 23 benchmarks in common in our data — those are the only rows where a direct, apples-to-apples comparison is drawn.
Claude Opus 4.6 leads reasoning 5–0. Claude Opus 4.6 leads agentic 3–0.