Verdict
Claude Opus 4.6 leads 15–0 across 15 shared benchmarks.
Claude Opus 4.6 15 · Claude Sonnet 4.6 0 · higher isn't always better — check the caveats below.
Reported scores — protocols may differ. How we compare
Reasoning: Claude Opus 4.6 leads 4–0 across 4 shared reasoning benchmarks (largest gap: SimpleQA Verified, 46.49 vs 29 — single evaluator).
Coding: Claude Opus 4.6 leads 2–0 across 2 shared coding benchmarks (largest gap: Terminal Bench, 79.8 vs 53.4 — single evaluator).
Unknown: Claude Opus 4.6 leads 2–0 across 2 shared unknown benchmarks (largest gap: Mystery Game Puzzles, 17.38 vs 7.47 — single evaluator).
Vendor claims — compare against the measured scores above. A claim is what a developer says about its own model, not an independent measurement.
Coding
“The new Claude Opus 4.6 improves on its predecessor's coding skills”
No vendor claims on file for Claude Sonnet 4.6.
Claude Opus 4.6 leads 15–0 across 15 shared benchmarks. Claude Opus 4.6 leads 15 benchmarks and Claude Sonnet 4.6 leads 0. Higher isn't always better — see the integrity caveats on each benchmark.
Claude Opus 4.6 and Claude Sonnet 4.6 have 15 benchmarks in common in our data — those are the only rows where a direct, apples-to-apples comparison is drawn.
Claude Opus 4.6 leads reasoning 4–0. Claude Opus 4.6 leads coding 2–0.