Lower-cost GPT-6 model for coding and everyday work. Independent measurements track max effort; missing evaluations are not estimated.
SI v3 uses weighted percentages from one Artificial Analysis configuration. Ranking requires all five benchmarks. Partial scores average only available weights. Scores are not comparable to SI v2 or a probability of reaching singularity.
| Benchmark | Score | Rank |
|---|---|---|
ARC-AGIARC Prize Novel reasoning tasks requiring fluid intelligence | 61.8% | #19 / 36 |
HLEArtificial Analysis Challenging multidisciplinary questions evaluated by Artificial Analysis | 38.5% | #41 / 91 |
| Benchmark / source | Score |
|---|---|
HLE Artificial AnalysisGPT-6 Luna (max) Verified 2026-09-25 | 38.5% |
MMMU-Pro Artificial AnalysisGPT-6 Luna (max) Verified 2026-09-25 | 75.5% |
Terminal-Bench 4.0 Artificial AnalysisGPT-6 Luna (max) Verified 2026-09-25 | 12.6% |
SciCode Artificial AnalysisGPT-6 Luna (max) Verified 2026-09-25 | 54.6% |
AA-LCR Artificial AnalysisGPT-6 Luna (max) Verified 2026-09-25 | 83.3% |
CritPt Artificial AnalysisGPT-6 Luna (max) Verified 2026-09-25 | 19.4% |
DeepSWE 1.1 Provider reportOpenAI research/API evaluation; max effort Verified 2026-09-25 | 66.6% |