Reasoning model for coding and professional work. Independent measurements track max effort.
SI v3 uses weighted percentages from one Artificial Analysis configuration. Ranking requires all five benchmarks. Partial scores average only available weights. Scores are not comparable to SI v2 or a probability of reaching singularity.
| Benchmark | Score | Rank |
|---|---|---|
HLEArtificial Analysis Challenging multidisciplinary questions evaluated by Artificial Analysis | 47.9% | #10 / 91 |
| Benchmark / source | Score |
|---|---|
HLE Artificial AnalysisGPT-6 Sol (max) Verified 2026-09-25 | 47.9% |
MMMU-Pro Artificial AnalysisGPT-6 Sol (max) Verified 2026-09-25 | 83.3% |
Terminal-Bench 4.0 Artificial AnalysisGPT-6 Sol (max) Verified 2026-09-25 | 43.9% |
SciCode Artificial AnalysisGPT-6 Sol (max) Verified 2026-09-25 | 57.6% |
AA-LCR Artificial AnalysisGPT-6 Sol (max) Verified 2026-09-25 | 83.7% |
CritPt Artificial AnalysisGPT-6 Sol (max) Verified 2026-09-25 | 30.9% |
ITBench SRE Artificial AnalysisGPT-6 Sol (max) Verified 2026-09-25 | 49.4% |
DeepSWE 1.1 Provider reportOpenAI research/API evaluation; effort specified per result; Max effort Verified 2026-09-25 | 68.8% |
Agents' Last Exam V1 Provider reportOpenAI research/API evaluation; effort specified per result; Max effort Verified 2026-09-25 | 56.4% |
AutomationBench 1.0.6 Provider reportOpenAI research/API evaluation; effort specified per result; Xhigh effort Verified 2026-09-25 | 33.2% |
OSWorld 2.0 offline Provider reportOpenAI research/API evaluation; effort specified per result; Xhigh effort; partial reward; v2026.08.08 Verified 2026-09-25 | 60.5% |