Skip to main content
Benchmark Registry
ModelsBenchmarksOrganizations

Terminal-Bench

Benchmark
Terminal-Bench
Evaluated by
Terminal-Bench Team
Release date
August 28, 2026
Version
Terminal-Bench 4.0
Metric
Terminal-Bench Accuracy

Results

6 results

LatestHistory
All providersAnthropicGoogle (DeepMind)OpenAISpaceXAI
Terminal-Bench 4.0 results
ProviderModelScoreSourceRegistry No.
AnthropicClaude Sonnet 5.5 (max)70.6%Source for Claude Sonnet 5.5 (max) on Terminal-Bench 4.0 (opens in a new tab)20016
AnthropicClaude Opus 5.5 (xhigh)66.4%Source for Claude Opus 5.5 (xhigh) on Terminal-Bench 4.0 (opens in a new tab)20015
SpaceXAIGrok 4.7 (xhigh)37.6%Source for Grok 4.7 (xhigh) on Terminal-Bench 4.0 (opens in a new tab)40003
OpenAIGPT-6 Astra57.9%Source for GPT-6 Astra on Terminal-Bench 4.0 (opens in a new tab)10005
Google (DeepMind)Gemini 3.8 Flash19.1%Source for Gemini 3.8 Flash on Terminal-Bench 4.0 (opens in a new tab)30004
AnthropicClaude Fable 5.155.8%Source for Claude Fable 5.1 on Terminal-Bench 4.0 (opens in a new tab)20004
Page 1 of 1

© 2026 Densa Labs

Toggle between the data update date and the application build time.
Legal
Color theme