Skip to main content
Benchmark Registry
ModelsBenchmarksOrganizations

SWE-bench

Benchmark
SWE-bench
Evaluated by
OpenAI, Princeton University
Release date
August 13, 2024
Version
SWE-bench Verified
Metric
Resolved Tasks

Results

7 results

LatestHistory
All providersAlibaba (Tongyi)AnthropicDeepSeek AIGoogle (DeepMind)Meta AI (originally Facebook AI Research)Microsoft AIMiniMaxMistral AIMoonshot AINVIDIAOpenAIZ.ai
SWE-bench Verified results
ProviderModelScoreSourceRegistry No.
Alibaba (Tongyi)Qwen3.7-Plus77.7%Source for Qwen3.7-Plus on SWE-bench Verified (opens in a new tab)130007
Alibaba (Tongyi)Qwen3.7-Max80.4%Source for Qwen3.7-Max on SWE-bench Verified (opens in a new tab)130006
Alibaba (Tongyi)Qwen3.6-35B-A3B73.4%Source for Qwen3.6-35B-A3B on SWE-bench Verified (opens in a new tab)130005
Alibaba (Tongyi)Qwen3.6-Plus78.8%Source for Qwen3.6-Plus on SWE-bench Verified (opens in a new tab)130004
Alibaba (Tongyi)Qwen3.5-397B-A17B76.4%Source for Qwen3.5-397B-A17B on SWE-bench Verified (opens in a new tab)130003
Alibaba (Tongyi)Qwen3-Max-Thinking75.3%Source for Qwen3-Max-Thinking on SWE-bench Verified (opens in a new tab)130002
Alibaba (Tongyi)Qwen3-Max-Instruct69.6%Source for Qwen3-Max-Instruct on SWE-bench Verified (opens in a new tab)130001
Page 1 of 1

© 2026 Densa Labs

Toggle between the data update date and the application build time.
Legal
Color theme