Results

23 results

SWE-bench Pro Public results
ProviderModelScoreSourceRegistry No.
AnthropicClaude Sonnet 5.5 (max)81.3%Source for Claude Sonnet 5.5 (max) on SWE-bench Pro Public (opens in a new tab)20016
Microsoft AIMAI-Thinking-152.8%Source for MAI-Thinking-1 on SWE-bench Pro Public (opens in a new tab)70003
Meta AI (originally Facebook AI Research)Muse Glimmer 30B (high)51.2%Source for Muse Glimmer 30B (high) on SWE-bench Pro Public (opens in a new tab)80004
Thinking Machines LabInkling-Small (effort=0.99)55.9%Source for Inkling-Small (effort=0.99) on SWE-bench Pro Public (opens in a new tab)160002
Google (DeepMind)Gemini 3.6 Flash58.7%Source for Gemini 3.6 Flash on SWE-bench Pro Public (opens in a new tab)30007
SpaceXAIGrok 4.564.7%Source for Grok 4.5 on SWE-bench Pro Public (opens in a new tab)40001
Thinking Machines LabInkling (effort=0.99)54.3%Source for Inkling (effort=0.99) on SWE-bench Pro Public (opens in a new tab)160001
Meta AI (originally Facebook AI Research)Muse Spark 1.1 (xhigh)61.5%Source for Muse Spark 1.1 (xhigh) on SWE-bench Pro Public (opens in a new tab)80002
Z.aiGLM-5.262.1%Source for GLM-5.2 on SWE-bench Pro Public (opens in a new tab)150004
MiniMaxMiniMax M359.0%Source for MiniMax M3 on SWE-bench Pro Public (opens in a new tab)140003
AnthropicClaude Opus 4.8 (adaptive thinking, max)69.2%Source for Claude Opus 4.8 (adaptive thinking, max) on SWE-bench Pro Public (opens in a new tab)20011
Google (DeepMind)Gemini 3.5 Flash55.1%Source for Gemini 3.5 Flash on SWE-bench Pro Public (opens in a new tab)30006
DeepSeek AIDeepSeek-V4-Flash (max)52.6%Source for DeepSeek-V4-Flash (max) on SWE-bench Pro Public (opens in a new tab)110001
DeepSeek AIDeepSeek-V4-Pro (max)55.4%Source for DeepSeek-V4-Pro (max) on SWE-bench Pro Public (opens in a new tab)110002
Moonshot AIKimi K2.6 (thinking)58.6%Source for Kimi K2.6 (thinking) on SWE-bench Pro Public (opens in a new tab)120002
AnthropicClaude Opus 4.7 (adaptive thinking, max)64.3%Source for Claude Opus 4.7 (adaptive thinking, max) on SWE-bench Pro Public (opens in a new tab)20010
Z.aiGLM-5.158.4%Source for GLM-5.1 on SWE-bench Pro Public (opens in a new tab)150003
MiniMaxMiniMax M2.756.2%Source for MiniMax M2.7 on SWE-bench Pro Public (opens in a new tab)140002
OpenAIGPT-5.4 (xhigh)57.7%Source for GPT-5.4 (xhigh) on SWE-bench Pro Public (opens in a new tab)10007
Google (DeepMind)Gemini 3.1 Pro (High)54.2%Source for Gemini 3.1 Pro (High) on SWE-bench Pro Public (opens in a new tab)30005
OpenAIGPT-5.3-Codex (xhigh)56.8%Source for GPT-5.3-Codex (xhigh) on SWE-bench Pro Public (opens in a new tab)10006
Moonshot AIKimi K2.5 (non-thinking)50.7%Source for Kimi K2.5 (non-thinking) on SWE-bench Pro Public (opens in a new tab)120001
OpenAIGPT-5.2 (xhigh)55.6%Source for GPT-5.2 (xhigh) on SWE-bench Pro Public (opens in a new tab)10012