Skip to main content
Benchmark Registry
ModelsBenchmarksOrganizations

SWE-bench

Benchmark
SWE-bench
Evaluated by
OpenAI, Princeton University
Release date
August 13, 2024
Version
SWE-bench Verified
Metric
Resolved Tasks

Results

6 results

LatestHistory
All providersAlibaba (Tongyi)AnthropicDeepSeek AIGoogle (DeepMind)Meta AI (originally Facebook AI Research)Microsoft AIMiniMaxMistral AIMoonshot AINVIDIAOpenAIZ.ai
SWE-bench Verified results
ProviderModelScoreSourceRegistry No.
Google (DeepMind)Gemini 3.1 Pro (High)80.6%Source for Gemini 3.1 Pro (High) on SWE-bench Verified (opens in a new tab)30005
Google (DeepMind)Gemini 3 Flash78.0%Source for Gemini 3 Flash on SWE-bench Verified (opens in a new tab)30009
Google (DeepMind)Gemini 3 Pro (high)76.2%Source for Gemini 3 Pro (high) on SWE-bench Verified (opens in a new tab)30008
Google (DeepMind)Gemini 2.0 Flash21.4%Source for Gemini 2.0 Flash on SWE-bench Verified (opens in a new tab)30001
Google (DeepMind)Gemini 2.5 Pro59.6%Source for Gemini 2.5 Pro on SWE-bench Verified (opens in a new tab)30002
Google (DeepMind)Gemini 2.5 Flash48.9%Source for Gemini 2.5 Flash on SWE-bench Verified (opens in a new tab)30003
Page 1 of 1

© 2026 Densa Labs

Toggle between the data update date and the application build time.
Legal
Color theme