Skip to main content
Benchmark Registry
Models
Benchmarks
Organizations
Search the registry
Search
Terminal-Bench
Benchmark
Terminal-Bench
Evaluated by
Terminal-Bench Team
Release date
August 28, 2026
Version
Terminal-Bench 4.0
Metric
Terminal-Bench Accuracy
Search models
Search
Results
3 results
Rows per page
50
100
500
Apply
Latest
History
All providers
Anthropic
Google (DeepMind)
OpenAI
SpaceXAI
Terminal-Bench 4.0 results
Provider
Model
Score
Source
Registry No.
Anthropic
Claude Sonnet 5.5
(max)
70.6%
Source
for Claude Sonnet 5.5 (max) on Terminal-Bench 4.0
(opens in a new tab)
20016
Anthropic
Claude Opus 5.5
(xhigh)
66.4%
Source
for Claude Opus 5.5 (xhigh) on Terminal-Bench 4.0
(opens in a new tab)
20015
Anthropic
Claude Fable 5.1
55.8%
Source
for Claude Fable 5.1 on Terminal-Bench 4.0
(opens in a new tab)
20004
Previous
Page
1
of
1
Next