Skip to main content
Benchmark Registry
ModelsBenchmarksOrganizations

Terminal-Bench

Benchmark
Terminal-Bench
Evaluated by
Terminal-Bench Team
Release date
May 6, 2026
Version
Terminal-Bench 2.1 — mini-swe-agent
Metric
Terminal-Bench Accuracy

Results

2 results

LatestHistory
All providersAnthropicMeta AI (originally Facebook AI Research)
Terminal-Bench 2.1 — mini-swe-agent results
ProviderModelScoreSourceRegistry No.
Meta AI (originally Facebook AI Research)Muse Spark 1.1 (xhigh)80.0%Source for Muse Spark 1.1 (xhigh) on Terminal-Bench 2.1 — mini-swe-agent (opens in a new tab)80002
AnthropicClaude Sonnet 5 (xhigh)80.4%Source for Claude Sonnet 5 (xhigh) on Terminal-Bench 2.1 — mini-swe-agent (opens in a new tab)20013
Page 1 of 1

© 2026 Densa Labs

Toggle between the data update date and the application build time.
Legal
Color theme