Open-weight coding model optimized for long-horizon software engineering and agentic tool use.
SI v3 uses weighted percentages from one Artificial Analysis configuration. Ranking requires all five benchmarks. Partial scores average only available weights. Scores are not comparable to SI v2 or a probability of reaching singularity.
Compared with models released within six months of it.
| Benchmark | Score | Rank |
|---|---|---|
TerminalArtificial Analysis Agentic terminal coding tasks requiring multi-step execution | 44.7% | #23 / 58 |
LiveCodeBenchvals.ai Contamination-free competitive programming (filtered by cutoff date) | 82.1% | #39 / 62 |
GPQAArtificial Analysis PhD-level science questions even experts struggle with | 89.6% | #42 / 95 |
HLEArtificial Analysis Challenging multidisciplinary questions evaluated by Artificial Analysis | 35% | #51 / 97 |
| Benchmark / source | Score |
|---|---|
HLE Artificial AnalysisKimi K2.7 Code | 35% |
Terminal-Bench 2.1 Artificial AnalysisKimi K2.7 Code | 67.4% |
Terminal-Bench 4.0 Artificial AnalysisKimi K2.7 Code | 1% |
SciCode Artificial AnalysisKimi K2.7 Code | 47.8% |
AA-LCR Artificial AnalysisKimi K2.7 Code | 79.3% |
CritPt Artificial AnalysisKimi K2.7 Code | 10% |
IFBench Artificial AnalysisKimi K2.7 Code | 63.1% |