First Sonnet of the Claude 5 generation. Terminal-Bench 2.1 80.4% and GDPval-AA v2 parity with Opus 4.8 (1618 vs 1615) at Sonnet-tier cost.
SI v3 uses weighted percentages from one Artificial Analysis configuration. Ranking requires all five benchmarks. Partial scores average only available weights. Scores are not comparable to SI v2 or a probability of reaching singularity.
Compared with 71 models released within six months of it, across 6 benchmarks where scores spread out.
| Benchmark | Score | Rank |
|---|---|---|
OSWorld Computer use in real desktop environments | 81.2% | #1 / 13 |
Terminal Agentic terminal coding tasks requiring multi-step execution | 80.4% | #6 / 58 |
MMLU-Provals.ai Harder 10-option successor to MMLU; more reasoning-focused | 87.5% | #26 / 61 |
MMMUvals.ai College-level multimodal reasoning across 30+ disciplines | 83% | #31 / 51 |
HLEArtificial Analysis Challenging multidisciplinary questions evaluated by Artificial Analysis | 41.3% | #33 / 97 |
GPQAArtificial Analysis PhD-level science questions even experts struggle with | 91.1% | #35 / 95 |
LiveCodeBenchvals.ai Contamination-free competitive programming (filtered by cutoff date) | 82.4% | #36 / 62 |
| Benchmark / source | Score |
|---|---|
HLE Artificial AnalysisClaude Sonnet 5 (Max) | 41.3% |
MMMU-Pro Artificial AnalysisClaude Sonnet 5 (Max) | 77.3% |
Terminal-Bench 2.1 Artificial AnalysisClaude Sonnet 5 (Max) | 80.5% |
Terminal-Bench 4.0 Artificial AnalysisClaude Sonnet 5 (Max) | 14.1% |
SciCode Artificial AnalysisClaude Sonnet 5 (Max) | 54.3% |
AA-LCR Artificial AnalysisClaude Sonnet 5 (Max) | 82% |
CritPt Artificial AnalysisClaude Sonnet 5 (Max) | 16.9% |