| Microsoft AI | MAI-Thinking-1 | 46.0% | Source for MAI-Thinking-1 on Terminal-Bench 2.0 (opens in a new tab) | 70003 |
| Cursor | Composer 2.5 | 69.3% | Source for Composer 2.5 on Terminal-Bench 2.0 (opens in a new tab) | 50004 |
| DeepSeek AI | DeepSeek-V4-Flash (max) | 56.9% | Source for DeepSeek-V4-Flash (max) on Terminal-Bench 2.0 (opens in a new tab) | 110001 |
| DeepSeek AI | DeepSeek-V4-Pro (max) | 67.9% | Source for DeepSeek-V4-Pro (max) on Terminal-Bench 2.0 (opens in a new tab) | 110002 |
| OpenAI | GPT-5.5 (xhigh) | 82.7% | Source for GPT-5.5 (xhigh) on Terminal-Bench 2.0 (opens in a new tab) | 10008 |
| Moonshot AI | Kimi K2.6 (thinking) | 66.7% | Source for Kimi K2.6 (thinking) on Terminal-Bench 2.0 (opens in a new tab) | 120002 |
| Anthropic | Claude Opus 4.7 (no thinking) | 69.4% | Source for Claude Opus 4.7 (no thinking) on Terminal-Bench 2.0 (opens in a new tab) | 20010 |
| Meta AI (originally Facebook AI Research) | Muse Spark (thinking) | 59.0% | Source for Muse Spark (thinking) on Terminal-Bench 2.0 (opens in a new tab) | 80001 |
| Cursor | Composer 1 | 40.0% | Source for Composer 1 on Terminal-Bench 2.0 (opens in a new tab) | 50001 |
| Cursor | Composer 1.5 | 47.9% | Source for Composer 1.5 on Terminal-Bench 2.0 (opens in a new tab) | 50002 |
| Cursor | Composer 2 | 61.7% | Source for Composer 2 on Terminal-Bench 2.0 (opens in a new tab) | 50003 |
| MiniMax | MiniMax M2.7 | 57.0% | Source for MiniMax M2.7 on Terminal-Bench 2.0 (opens in a new tab) | 140002 |
| NVIDIA | NVIDIA Nemotron 3 Super 120B-A12B | 31.0% | Source for NVIDIA Nemotron 3 Super 120B-A12B on Terminal-Bench 2.0 (opens in a new tab) | 60002 |
| OpenAI | GPT-5.4 (xhigh) | 75.1% | Source for GPT-5.4 (xhigh) on Terminal-Bench 2.0 (opens in a new tab) | 10007 |
| Google (DeepMind) | Gemini 3.1 Pro (High) | 68.5% | Source for Gemini 3.1 Pro (High) on Terminal-Bench 2.0 (opens in a new tab) | 30005 |
| Anthropic | Claude Sonnet 4.6 (no thinking, max effort) | 59.1% | Source for Claude Sonnet 4.6 (no thinking, max effort) on Terminal-Bench 2.0 (opens in a new tab) | 20009 |
| OpenAI | GPT-5.3-Codex (xhigh) | 77.3% | Source for GPT-5.3-Codex (xhigh) on Terminal-Bench 2.0 (opens in a new tab) | 10006 |
| Anthropic | Claude Opus 4.6 (adaptive thinking, max) | 65.4% | Source for Claude Opus 4.6 (adaptive thinking, max) on Terminal-Bench 2.0 (opens in a new tab) | 20008 |
| Moonshot AI | Kimi K2.5 (non-thinking) | 50.8% | Source for Kimi K2.5 (non-thinking) on Terminal-Bench 2.0 (opens in a new tab) | 120001 |
| Z.ai | GLM-4.7 | 41.0% | Source for GLM-4.7 on Terminal-Bench 2.0 (opens in a new tab) | 150001 |
| Mistral AI | Devstral 2 | 32.6% | Source for Devstral 2 on Terminal-Bench 2.0 (opens in a new tab) | 90002 |
| Mistral AI | Devstral Small 2 | 22.5% | Source for Devstral Small 2 on Terminal-Bench 2.0 (opens in a new tab) | 90003 |
| Anthropic | Claude Opus 4.5 (extended thinking (128K)) | 59.8% | Source for Claude Opus 4.5 (extended thinking (128K)) on Terminal-Bench 2.0 (opens in a new tab) | 20007 |
| Google (DeepMind) | Gemini 3 Pro (high) | 54.2% | Source for Gemini 3 Pro (high) on Terminal-Bench 2.0 (opens in a new tab) | 30008 |
| Anthropic | Claude Haiku 4.5 (extended thinking (32K)) | 41.8% | Source for Claude Haiku 4.5 (extended thinking (32K)) on Terminal-Bench 2.0 (opens in a new tab) | 20006 |
| Anthropic | Claude Haiku 4.5 (no thinking) | 40.2% | Source for Claude Haiku 4.5 (no thinking) on Terminal-Bench 2.0 (opens in a new tab) | 20006 |