Skip to main content
Benchmark Registry
Models
Benchmarks
Organizations
Compare
Search the registry
Search
Terminal-Bench
Benchmark
Terminal-Bench
Evaluated by
Terminal-Bench Team
Release date
November 7, 2025
Version
Terminal-Bench 2.0
Metric
Terminal-Bench Accuracy
Search models
Search
Results
2 results
Rows per page
50
100
500
Apply
Latest
History
All providers
Anthropic
Cursor
DeepSeek AI
Google (DeepMind)
Meta AI (originally Facebook AI Research)
Microsoft AI
MiniMax
Mistral AI
Moonshot AI
NVIDIA
OpenAI
Z.ai
Terminal-Bench 2.0 results
Provider
Model
Score
Source
Registry No.
Moonshot AI
Kimi K2.6
(thinking)
66.7%
Source
for Kimi K2.6 (thinking) on Terminal-Bench 2.0
(opens in a new tab)
120002
Moonshot AI
Kimi K2.5
(non-thinking)
50.8%
Source
for Kimi K2.5 (non-thinking) on Terminal-Bench 2.0
(opens in a new tab)
120001
Previous
Page
1
of
1
Next