Skip to main content
Benchmark Registry
ModelsBenchmarksOrganizationsCompare

MedXpertQA

Benchmark
MedXpertQA
Evaluated by
Google DeepMind
Release date
January 30, 2025
Version
MedXpertQA MM
Metric
Accuracy

Results

8 results

LatestHistory
All providersAlibaba (Tongyi)Google (DeepMind)
MedXpertQA MM results
ProviderModelScoreSourceRegistry No.
Alibaba (Tongyi)Qwen3.8-Max80.4%Source for Qwen3.8-Max on MedXpertQA MM (opens in a new tab)130008
Google (DeepMind)Gemma 4 26B A4B Instruct (thinking mode)58.1%Source for Gemma 4 26B A4B Instruct (thinking mode) on MedXpertQA MM (opens in a new tab)35001
Google (DeepMind)Gemma 4 31B Instruct (thinking mode)61.3%Source for Gemma 4 31B Instruct (thinking mode) on MedXpertQA MM (opens in a new tab)35002
Google (DeepMind)Gemma 4 E2B Instruct (thinking mode)23.5%Source for Gemma 4 E2B Instruct (thinking mode) on MedXpertQA MM (opens in a new tab)35003
Google (DeepMind)Gemma 4 E4B Instruct (thinking mode)28.7%Source for Gemma 4 E4B Instruct (thinking mode) on MedXpertQA MM (opens in a new tab)35004
Google (DeepMind)Gemma 4 12B Instruct (thinking mode)48.7%Source for Gemma 4 12B Instruct (thinking mode) on MedXpertQA MM (opens in a new tab)35005
Alibaba (Tongyi)Qwen3.6-Plus68.7%Source for Qwen3.6-Plus on MedXpertQA MM (opens in a new tab)130004
Alibaba (Tongyi)Qwen3.7-Plus71.0%Source for Qwen3.7-Plus on MedXpertQA MM (opens in a new tab)130007
Page 1 of 1

© 2026 Densa Labs

Toggle between the data update date and the application build time.
Legal
Color theme