Results

26 results

Terminal-Bench 2.0 results
ProviderModelScoreSourceRegistry No.
Microsoft AIMAI-Thinking-146.0%Source for MAI-Thinking-1 on Terminal-Bench 2.0 (opens in a new tab)70003
CursorComposer 2.569.3%Source for Composer 2.5 on Terminal-Bench 2.0 (opens in a new tab)50004
DeepSeek AIDeepSeek-V4-Flash (max)56.9%Source for DeepSeek-V4-Flash (max) on Terminal-Bench 2.0 (opens in a new tab)110001
DeepSeek AIDeepSeek-V4-Pro (max)67.9%Source for DeepSeek-V4-Pro (max) on Terminal-Bench 2.0 (opens in a new tab)110002
OpenAIGPT-5.5 (xhigh)82.7%Source for GPT-5.5 (xhigh) on Terminal-Bench 2.0 (opens in a new tab)10008
Moonshot AIKimi K2.6 (thinking)66.7%Source for Kimi K2.6 (thinking) on Terminal-Bench 2.0 (opens in a new tab)120002
AnthropicClaude Opus 4.7 (no thinking)69.4%Source for Claude Opus 4.7 (no thinking) on Terminal-Bench 2.0 (opens in a new tab)20010
Meta AI (originally Facebook AI Research)Muse Spark (thinking)59.0%Source for Muse Spark (thinking) on Terminal-Bench 2.0 (opens in a new tab)80001
CursorComposer 140.0%Source for Composer 1 on Terminal-Bench 2.0 (opens in a new tab)50001
CursorComposer 1.547.9%Source for Composer 1.5 on Terminal-Bench 2.0 (opens in a new tab)50002
CursorComposer 261.7%Source for Composer 2 on Terminal-Bench 2.0 (opens in a new tab)50003
MiniMaxMiniMax M2.757.0%Source for MiniMax M2.7 on Terminal-Bench 2.0 (opens in a new tab)140002
NVIDIANVIDIA Nemotron 3 Super 120B-A12B31.0%Source for NVIDIA Nemotron 3 Super 120B-A12B on Terminal-Bench 2.0 (opens in a new tab)60002
OpenAIGPT-5.4 (xhigh)75.1%Source for GPT-5.4 (xhigh) on Terminal-Bench 2.0 (opens in a new tab)10007
Google (DeepMind)Gemini 3.1 Pro (High)68.5%Source for Gemini 3.1 Pro (High) on Terminal-Bench 2.0 (opens in a new tab)30005
AnthropicClaude Sonnet 4.6 (no thinking, max effort)59.1%Source for Claude Sonnet 4.6 (no thinking, max effort) on Terminal-Bench 2.0 (opens in a new tab)20009
OpenAIGPT-5.3-Codex (xhigh)77.3%Source for GPT-5.3-Codex (xhigh) on Terminal-Bench 2.0 (opens in a new tab)10006
AnthropicClaude Opus 4.6 (adaptive thinking, max)65.4%Source for Claude Opus 4.6 (adaptive thinking, max) on Terminal-Bench 2.0 (opens in a new tab)20008
Moonshot AIKimi K2.5 (non-thinking)50.8%Source for Kimi K2.5 (non-thinking) on Terminal-Bench 2.0 (opens in a new tab)120001
Z.aiGLM-4.741.0%Source for GLM-4.7 on Terminal-Bench 2.0 (opens in a new tab)150001
Mistral AIDevstral 232.6%Source for Devstral 2 on Terminal-Bench 2.0 (opens in a new tab)90002
Mistral AIDevstral Small 222.5%Source for Devstral Small 2 on Terminal-Bench 2.0 (opens in a new tab)90003
AnthropicClaude Opus 4.5 (extended thinking (128K))59.8%Source for Claude Opus 4.5 (extended thinking (128K)) on Terminal-Bench 2.0 (opens in a new tab)20007
Google (DeepMind)Gemini 3 Pro (high)54.2%Source for Gemini 3 Pro (high) on Terminal-Bench 2.0 (opens in a new tab)30008
AnthropicClaude Haiku 4.5 (extended thinking (32K))41.8%Source for Claude Haiku 4.5 (extended thinking (32K)) on Terminal-Bench 2.0 (opens in a new tab)20006
AnthropicClaude Haiku 4.5 (no thinking)40.2%Source for Claude Haiku 4.5 (no thinking) on Terminal-Bench 2.0 (opens in a new tab)20006