Flash-tier successor to 3.6 posting GPQA 94.5 and ARC-AGI-2 85.3 — frontier-level reasoning at the cost-efficient tier.
SI v3 uses weighted percentages from one Artificial Analysis configuration. Ranking requires all five benchmarks. Partial scores average only available weights. Scores are not comparable to SI v2 or a probability of reaching singularity.
Compared with 66 models released within six months of it, across 5 benchmarks where scores spread out.
| Benchmark | Score | Rank |
|---|---|---|
GPQAArtificial Analysis PhD-level science questions even experts struggle with | 94.5% | #4 / 95 |
LiveCodeBenchvals.ai Contamination-free competitive programming (filtered by cutoff date) | 88.7% | #5 / 62 |
MMMUvals.ai College-level multimodal reasoning across 30+ disciplines | 89% | #5 / 51 |
MMLU-Provals.ai Harder 10-option successor to MMLU; more reasoning-focused | 90.1% | #7 / 61 |
AA Coding (Historical) Archived release-era coding composite, excluded from current rankings because comparable current-series coverage is unavailable | 76.1% | #9 / 22 |
ARC-AGIARC Prize Novel reasoning tasks requiring fluid intelligence | 85.3% | #11 / 39 |
AA Intelligence (Historical) Archived release-era composite, not comparable to the current versioned Intelligence Index used for rankings | 56% | #12 / 22 |
aaAgentic | 45.1% | #13 / 16 |
HLEArtificial Analysis Challenging multidisciplinary questions evaluated by Artificial Analysis | 47.9% | #14 / 97 |
| Benchmark / source | Score |
|---|---|
HLE Artificial AnalysisGemini 3.7 Flash (High) | 47.9% |
MMMU-Pro Artificial AnalysisGemini 3.7 Flash (High) | 85.5% |
Terminal-Bench 2.1 Artificial AnalysisGemini 3.7 Flash (High) | 85.8% |
Terminal-Bench 4.0 Artificial AnalysisGemini 3.7 Flash (High) | 13.6% |
SciCode Artificial AnalysisGemini 3.7 Flash (High) | 57.2% |
AA-LCR Artificial AnalysisGemini 3.7 Flash (High) | 81.7% |
CritPt Artificial AnalysisGemini 3.7 Flash (High) | 14.3% |