Skip to main content
Benchmark Registry
ModelsBenchmarksOrganizations

CharXiv

Benchmark
CharXiv
Evaluated by
OpenAI
Release date
December 11, 2025
Version
CharXiv Reasoning — Python enabled
Metric
CharXiv Accuracy

Results

4 results

LatestHistory
All providersAnthropicMoonshot AIOpenAIThinking Machines Lab
CharXiv Reasoning — Python enabled results
ProviderModelScoreSourceRegistry No.
Thinking Machines LabInkling (effort=0.99)82.0%Source for Inkling (effort=0.99) on CharXiv Reasoning — Python enabled (opens in a new tab)160001
AnthropicClaude Sonnet 5 (max)88.3%Source for Claude Sonnet 5 (max) on CharXiv Reasoning — Python enabled (opens in a new tab)20013
Moonshot AIKimi K2.6 (thinking)86.7%Source for Kimi K2.6 (thinking) on CharXiv Reasoning — Python enabled (opens in a new tab)120002
OpenAIGPT-5.2 (xhigh)88.7%Source for GPT-5.2 (xhigh) on CharXiv Reasoning — Python enabled (opens in a new tab)10012
Page 1 of 1

© 2026 Densa Labs

Toggle between the data update date and the application build time.
Legal
Color theme