Skip to main content
Benchmark Registry
Models
Benchmarks
Organizations
Search the registry
Search
Terminal-Bench
Benchmark
Terminal-Bench
Evaluated by
Terminal-Bench Team
Release date
May 6, 2026
Version
Terminal-Bench 2.1 — mini-swe-agent
Metric
Terminal-Bench Accuracy
Search models
Search
Results
2 results
Rows per page
50
100
500
Apply
Latest
History
All providers
Anthropic
Meta AI (originally Facebook AI Research)
Terminal-Bench 2.1 — mini-swe-agent results
Provider
Model
Score
Source
Registry No.
Meta AI (originally Facebook AI Research)
Muse Spark 1.1
(xhigh)
80.0%
Source
for Muse Spark 1.1 (xhigh) on Terminal-Bench 2.1 — mini-swe-agent
(opens in a new tab)
80002
Anthropic
Claude Sonnet 5
(xhigh)
80.4%
Source
for Claude Sonnet 5 (xhigh) on Terminal-Bench 2.1 — mini-swe-agent
(opens in a new tab)
20013
Previous
Page
1
of
1
Next