Skip to main content
Benchmark Registry
Models
Benchmarks
Organizations
Search the registry
Search
SWE-bench Pro
Benchmark
SWE-bench Pro
Evaluated by
Scale AI
Release date
September 19, 2025
Version
SWE-bench Pro Public
Metric
Public tasks resolved
Search models
Search
Results
2 results
Rows per page
50
100
500
Apply
Latest
History
All providers
Anthropic
DeepSeek AI
Google (DeepMind)
Meta AI (originally Facebook AI Research)
Microsoft AI
MiniMax
Moonshot AI
OpenAI
SpaceXAI
Thinking Machines Lab
Z.ai
SWE-bench Pro Public results
Provider
Model
Score
Source
Registry No.
Moonshot AI
Kimi K2.6
(thinking)
58.6%
Source
for Kimi K2.6 (thinking) on SWE-bench Pro Public
(opens in a new tab)
120002
Moonshot AI
Kimi K2.5
(non-thinking)
50.7%
Source
for Kimi K2.5 (non-thinking) on SWE-bench Pro Public
(opens in a new tab)
120001
Previous
Page
1
of
1
Next