Skip to main content
Benchmark Registry
Models
Benchmarks
Organizations
Search the registry
Search
GPQA
Graduate-Level Google-Proof Q&A
Benchmark
GPQA
Evaluated by
GPQA Authors
Release date
November 20, 2023
Version
GPQA Diamond
Metric
GPQA Diamond Accuracy
Search models
Search
Results
5 results
Rows per page
50
100
500
Apply
Latest
History
All providers
Alibaba (Tongyi)
Anthropic
DeepSeek AI
Google (DeepMind)
Microsoft AI
Mistral AI
Moonshot AI
NVIDIA
OpenAI
Thinking Machines Lab
Z.ai
Graduate-Level Google-Proof Q&A Diamond results
Provider
Model
Score
Source
Registry No.
Alibaba (Tongyi)
Qwen3.8-Max
92.6%
Source
for Qwen3.8-Max on Graduate-Level Google-Proof Q&A Diamond
(opens in a new tab)
130008
Alibaba (Tongyi)
Qwen3.7-Plus
90.3%
Source
for Qwen3.7-Plus on Graduate-Level Google-Proof Q&A Diamond
(opens in a new tab)
130007
Alibaba (Tongyi)
Qwen3.7-Max
92.4%
Source
for Qwen3.7-Max on Graduate-Level Google-Proof Q&A Diamond
(opens in a new tab)
130006
Alibaba (Tongyi)
Qwen3.5-397B-A17B
88.4%
Source
for Qwen3.5-397B-A17B on Graduate-Level Google-Proof Q&A Diamond
(opens in a new tab)
130003
Alibaba (Tongyi)
Qwen3-Max-Thinking
87.4%
Source
for Qwen3-Max-Thinking on Graduate-Level Google-Proof Q&A Diamond
(opens in a new tab)
130002
Previous
Page
1
of
1
Next