| Anthropic | Claude Sonnet 5.5 (max) | 81.3% | Source for Claude Sonnet 5.5 (max) on SWE-bench Pro Public (opens in a new tab) | 20016 |
| Microsoft AI | MAI-Thinking-1 | 52.8% | Source for MAI-Thinking-1 on SWE-bench Pro Public (opens in a new tab) | 70003 |
| Meta AI (originally Facebook AI Research) | Muse Glimmer 30B (high) | 51.2% | Source for Muse Glimmer 30B (high) on SWE-bench Pro Public (opens in a new tab) | 80004 |
| Thinking Machines Lab | Inkling-Small (effort=0.99) | 55.9% | Source for Inkling-Small (effort=0.99) on SWE-bench Pro Public (opens in a new tab) | 160002 |
| Google (DeepMind) | Gemini 3.6 Flash | 58.7% | Source for Gemini 3.6 Flash on SWE-bench Pro Public (opens in a new tab) | 30007 |
| SpaceXAI | Grok 4.5 | 64.7% | Source for Grok 4.5 on SWE-bench Pro Public (opens in a new tab) | 40001 |
| Thinking Machines Lab | Inkling (effort=0.99) | 54.3% | Source for Inkling (effort=0.99) on SWE-bench Pro Public (opens in a new tab) | 160001 |
| Meta AI (originally Facebook AI Research) | Muse Spark 1.1 (xhigh) | 61.5% | Source for Muse Spark 1.1 (xhigh) on SWE-bench Pro Public (opens in a new tab) | 80002 |
| Z.ai | GLM-5.2 | 62.1% | Source for GLM-5.2 on SWE-bench Pro Public (opens in a new tab) | 150004 |
| MiniMax | MiniMax M3 | 59.0% | Source for MiniMax M3 on SWE-bench Pro Public (opens in a new tab) | 140003 |
| Anthropic | Claude Opus 4.8 (adaptive thinking, max) | 69.2% | Source for Claude Opus 4.8 (adaptive thinking, max) on SWE-bench Pro Public (opens in a new tab) | 20011 |
| Google (DeepMind) | Gemini 3.5 Flash | 55.1% | Source for Gemini 3.5 Flash on SWE-bench Pro Public (opens in a new tab) | 30006 |
| DeepSeek AI | DeepSeek-V4-Flash (max) | 52.6% | Source for DeepSeek-V4-Flash (max) on SWE-bench Pro Public (opens in a new tab) | 110001 |
| DeepSeek AI | DeepSeek-V4-Pro (max) | 55.4% | Source for DeepSeek-V4-Pro (max) on SWE-bench Pro Public (opens in a new tab) | 110002 |
| Moonshot AI | Kimi K2.6 (thinking) | 58.6% | Source for Kimi K2.6 (thinking) on SWE-bench Pro Public (opens in a new tab) | 120002 |
| Anthropic | Claude Opus 4.7 (adaptive thinking, max) | 64.3% | Source for Claude Opus 4.7 (adaptive thinking, max) on SWE-bench Pro Public (opens in a new tab) | 20010 |
| Z.ai | GLM-5.1 | 58.4% | Source for GLM-5.1 on SWE-bench Pro Public (opens in a new tab) | 150003 |
| MiniMax | MiniMax M2.7 | 56.2% | Source for MiniMax M2.7 on SWE-bench Pro Public (opens in a new tab) | 140002 |
| OpenAI | GPT-5.4 (xhigh) | 57.7% | Source for GPT-5.4 (xhigh) on SWE-bench Pro Public (opens in a new tab) | 10007 |
| Google (DeepMind) | Gemini 3.1 Pro (High) | 54.2% | Source for Gemini 3.1 Pro (High) on SWE-bench Pro Public (opens in a new tab) | 30005 |
| OpenAI | GPT-5.3-Codex (xhigh) | 56.8% | Source for GPT-5.3-Codex (xhigh) on SWE-bench Pro Public (opens in a new tab) | 10006 |
| Moonshot AI | Kimi K2.5 (non-thinking) | 50.7% | Source for Kimi K2.5 (non-thinking) on SWE-bench Pro Public (opens in a new tab) | 120001 |
| OpenAI | GPT-5.2 (xhigh) | 55.6% | Source for GPT-5.2 (xhigh) on SWE-bench Pro Public (opens in a new tab) | 10012 |