Skip to main content
Benchmark Registry
ModelsBenchmarksOrganizations

SWE-bench

Benchmark
SWE-bench
Evaluated by
OpenAI, Princeton University
Release date
August 13, 2024
Version
SWE-bench Verified
Metric
Resolved Tasks

Results

6 results

LatestHistory
All providersAlibaba (Tongyi)AnthropicDeepSeek AIGoogle (DeepMind)Meta AI (originally Facebook AI Research)Microsoft AIMiniMaxMistral AIMoonshot AINVIDIAOpenAIZ.ai
SWE-bench Verified results
ProviderModelScoreSourceRegistry No.
OpenAIGPT-5.2 (xhigh)80.0%Source for GPT-5.2 (xhigh) on SWE-bench Verified (opens in a new tab)10012
OpenAIgpt-oss-120b (high)62.4%Source for gpt-oss-120b (high) on SWE-bench Verified (opens in a new tab)15001
OpenAIgpt-oss-120b (medium)52.6%Source for gpt-oss-120b (medium) on SWE-bench Verified (opens in a new tab)15001
OpenAIgpt-oss-120b (low)47.9%Source for gpt-oss-120b (low) on SWE-bench Verified (opens in a new tab)15001
OpenAIGPT-4.5 Preview38.0%Source for GPT-4.5 Preview on SWE-bench Verified (opens in a new tab)10001
OpenAIGPT-4.154.6%Source for GPT-4.1 on SWE-bench Verified (opens in a new tab)10002
Page 1 of 1

© 2026 Densa Labs

Toggle between the data update date and the application build time.
Legal
Color theme