Skip to main content
Benchmark Registry
ModelsBenchmarksOrganizationsCompare

HealthBench

Benchmark
HealthBench
Evaluated by
OpenAI
Release date
May 12, 2025
Version
HealthBench HealthBench Hard
Metric
HealthBench Score

Results

6 results

LatestHistory
All providersMeta AI (originally Facebook AI Research)OpenAI
HealthBench HealthBench Hard results
ProviderModelScoreSourceRegistry No.
Meta AI (originally Facebook AI Research)Muse Spark (thinking)42.8%Source for Muse Spark (thinking) on HealthBench HealthBench Hard (opens in a new tab)80001
OpenAIOpenAI o3 (high)31.6%Source for OpenAI o3 (high) on HealthBench HealthBench Hard (opens in a new tab)10003
OpenAIOpenAI o4-mini (high)17.5%Source for OpenAI o4-mini (high) on HealthBench HealthBench Hard (opens in a new tab)10004
OpenAIgpt-oss-120b (low)22.8%Source for gpt-oss-120b (low) on HealthBench HealthBench Hard (opens in a new tab)15001
OpenAIgpt-oss-120b (medium)26.9%Source for gpt-oss-120b (medium) on HealthBench HealthBench Hard (opens in a new tab)15001
OpenAIgpt-oss-120b (high)30.0%Source for gpt-oss-120b (high) on HealthBench HealthBench Hard (opens in a new tab)15001
Page 1 of 1

© 2026 Densa Labs

Toggle between the data update date and the application build time.
Legal
Color theme