Skip to main content
Benchmark Registry
Models
Benchmarks
Organizations
Search the registry
Search
SWE-bench
Benchmark
SWE-bench
Evaluated by
OpenAI, Princeton University
Release date
August 13, 2024
Version
SWE-bench Verified
Metric
Resolved Tasks
Search models
Search
Results
7 results
Rows per page
50
100
500
Apply
Latest
History
All providers
Alibaba (Tongyi)
Anthropic
DeepSeek AI
Google (DeepMind)
Meta AI (originally Facebook AI Research)
Microsoft AI
MiniMax
Mistral AI
Moonshot AI
NVIDIA
OpenAI
Z.ai
SWE-bench Verified results
Provider
Model
Score
Source
Registry No.
Alibaba (Tongyi)
Qwen3.7-Plus
77.7%
Source
for Qwen3.7-Plus on SWE-bench Verified
(opens in a new tab)
130007
Alibaba (Tongyi)
Qwen3.7-Max
80.4%
Source
for Qwen3.7-Max on SWE-bench Verified
(opens in a new tab)
130006
Alibaba (Tongyi)
Qwen3.6-35B-A3B
73.4%
Source
for Qwen3.6-35B-A3B on SWE-bench Verified
(opens in a new tab)
130005
Alibaba (Tongyi)
Qwen3.6-Plus
78.8%
Source
for Qwen3.6-Plus on SWE-bench Verified
(opens in a new tab)
130004
Alibaba (Tongyi)
Qwen3.5-397B-A17B
76.4%
Source
for Qwen3.5-397B-A17B on SWE-bench Verified
(opens in a new tab)
130003
Alibaba (Tongyi)
Qwen3-Max-Thinking
75.3%
Source
for Qwen3-Max-Thinking on SWE-bench Verified
(opens in a new tab)
130002
Alibaba (Tongyi)
Qwen3-Max-Instruct
69.6%
Source
for Qwen3-Max-Instruct on SWE-bench Verified
(opens in a new tab)
130001
Previous
Page
1
of
1
Next