Skip to main content
Benchmark Registry
ModelsBenchmarksOrganizationsCompare

MedXpertQA

Benchmark
MedXpertQA
Evaluated by
Google DeepMind
Release date
January 30, 2025
Version
MedXpertQA MM
Metric
Accuracy

Results

5 results

LatestHistory
All providersAlibaba (Tongyi)Google (DeepMind)
MedXpertQA MM results
ProviderModelScoreSourceRegistry No.
Google (DeepMind)Gemma 4 26B A4B Instruct (thinking mode)58.1%Source for Gemma 4 26B A4B Instruct (thinking mode) on MedXpertQA MM (opens in a new tab)35001
Google (DeepMind)Gemma 4 31B Instruct (thinking mode)61.3%Source for Gemma 4 31B Instruct (thinking mode) on MedXpertQA MM (opens in a new tab)35002
Google (DeepMind)Gemma 4 E2B Instruct (thinking mode)23.5%Source for Gemma 4 E2B Instruct (thinking mode) on MedXpertQA MM (opens in a new tab)35003
Google (DeepMind)Gemma 4 E4B Instruct (thinking mode)28.7%Source for Gemma 4 E4B Instruct (thinking mode) on MedXpertQA MM (opens in a new tab)35004
Google (DeepMind)Gemma 4 12B Instruct (thinking mode)48.7%Source for Gemma 4 12B Instruct (thinking mode) on MedXpertQA MM (opens in a new tab)35005
Page 1 of 1

© 2026 Densa Labs

Toggle between the data update date and the application build time.
Legal
Color theme