Evidence checked

Recent benchmark records with evidence checked 2026-10-03
ModelBenchmarkScoreSource
Gemini 4 ArgonCWE-bench 168.0%deepmind.google for Gemini 4 Argon on CWE-bench (opens in a new tab)
Gemini 4 ArgonLVBench 1 FPS — No tools91.7%deepmind.google for Gemini 4 Argon on LVBench (opens in a new tab)
Gemini 4 ArgonChartography No tools — September 2026 leaderboard71.6%deepmind.google for Gemini 4 Argon on Chartography (opens in a new tab)
Gemini 4 ArgonOSWorld 2.0 v2026.08.08 Offline — Partial, max of 3 runs69.2%deepmind.google for Gemini 4 Argon on OSWorld (opens in a new tab)
Gemini 4 ArgonAgent's Last Exam ALE-V1 — ALE-Claw, 5h39.5%deepmind.google for Gemini 4 Argon on Agent's Last Exam (opens in a new tab)
Gemini 4 ArgonGraphWalks 256k to 1M — BFS, 200 items84.2%deepmind.google for Gemini 4 Argon on GraphWalks (opens in a new tab)
Gemini 4 ArgonGraphWalks Up to 128k — BFS, 650 items99.7%deepmind.google for Gemini 4 Argon on GraphWalks (opens in a new tab)
Gemini 4 ArgonRiemann-bench September 2026 leaderboard76.0%deepmind.google for Gemini 4 Argon on Riemann-bench (opens in a new tab)
Gemini 4 ArgonLABBench2 Terminal and internet — September 2026 evaluation88.8%deepmind.google for Gemini 4 Argon on LABBench2 (opens in a new tab)
Gemini 4 ArgonTerminal-Bench Science 0.1 — 6x verifier timeout57.6%deepmind.google for Gemini 4 Argon on Terminal-Bench (opens in a new tab)
Gemini 4 ArgonPostTrainBench 1.1 — OpenCode45.3%deepmind.google for Gemini 4 Argon on PostTrainBench (opens in a new tab)
Gemini 4 ArgonTerminal-Bench 4.057.4%deepmind.google for Gemini 4 Argon on Terminal-Bench (opens in a new tab)
Gemini 4 ArgonVibe Code Bench 1.1 — OpenHands, September 2026 evaluation91.9%deepmind.google for Gemini 4 Argon on Vibe Code Bench (opens in a new tab)
Gemini 4 ArgonFrontierSWE 2 — September 2026 evaluation55.0%deepmind.google for Gemini 4 Argon on FrontierSWE (opens in a new tab)
Gemini 4 ArgonDeepSWE 1.1 — mini-swe-agent77.9%deepmind.google for Gemini 4 Argon on DeepSWE (opens in a new tab)
Gemini 4 ArgonHLAB September 2026 evaluation19.6%deepmind.google for Gemini 4 Argon on Harvey's Legal Agent Benchmark (opens in a new tab)
Gemini 4 ArgonFinance Agent Benchmark 2 — September 2026 evaluation65.4%deepmind.google for Gemini 4 Argon on Finance Agent Benchmark (opens in a new tab)
Gemini 4 ArgonAutomationBench 1.0.651.3%deepmind.google for Gemini 4 Argon on AutomationBench (opens in a new tab)
Gemini 4 ArgonVals Index 2.168.9%deepmind.google for Gemini 4 Argon on Vals Index (opens in a new tab)
Inkling-SmallCharXiv Reasoning — Python enabled81.3%thinkingmachines.ai for Inkling-Small on CharXiv (opens in a new tab)
Inkling-SmallCharXiv Reasoning — No tools77.4%thinkingmachines.ai for Inkling-Small on CharXiv (opens in a new tab)
Gemini 3.6 FlashLVBench 1024 frames — Static84.2%deepmind.google for Gemini 3.6 Flash on LVBench (opens in a new tab)
Gemini 3.7 FlashLVBench 1024 frames — Static85.4%deepmind.google for Gemini 3.7 Flash on LVBench (opens in a new tab)
Gemini 3.7 FlashCharXiv Reasoning — Search and code execution88.7%deepmind.google for Gemini 3.7 Flash on CharXiv (opens in a new tab)
Gemini 3.5 FlashCharXiv Reasoning — Search and code execution84.9%deepmind.google for Gemini 3.5 Flash on CharXiv (opens in a new tab)
Gemini 3.6 FlashCharXiv Reasoning — Search and code execution89.4%deepmind.google for Gemini 3.6 Flash on CharXiv (opens in a new tab)
Kimi K3Video-MME Original — With subtitles90.0%raw.githubusercontent.com for Kimi K3 on Video-MME (opens in a new tab)
Kimi K3BabyVision Original — Python enabled85.7%raw.githubusercontent.com for Kimi K3 on BabyVision (opens in a new tab)
Kimi K3MATH-Vision Original — Python enabled97.8%raw.githubusercontent.com for Kimi K3 on MATH-Vision (opens in a new tab)
Kimi K3MATH-Vision Original94.3%raw.githubusercontent.com for Kimi K3 on MATH-Vision (opens in a new tab)
Kimi K3CharXiv Reasoning — Python enabled91.3%raw.githubusercontent.com for Kimi K3 on CharXiv (opens in a new tab)
Gemma 4 12B InstructMMMLU Original83.4%arxiv.org for Gemma 4 12B Instruct on MMMLU (opens in a new tab)
Grok 4.5SWE-bench Multilingual78.0%cursor.com for Grok 4.5 on SWE-bench (opens in a new tab)

Evidence checked

Recent benchmark records with evidence checked 2026-10-02
ModelBenchmarkScoreSource
MiniMax M3BrowseComp83.5%minimax.io for MiniMax M3 on BrowseComp (opens in a new tab)
MiniMax M3CL-bench Original20.48%minimax.io for MiniMax M3 on CL-bench (opens in a new tab)
Qwen3.7-PlusRealWorldQA Original86.9%qwen.ai for Qwen3.7-Plus on RealWorldQA (opens in a new tab)
Qwen3.7-PlusMMMLU Original89.0%qwen.ai for Qwen3.7-Plus on MMMLU (opens in a new tab)
Qwen3.7-MaxMMMLU Original90.3%qwen.ai for Qwen3.7-Max on MMMLU (opens in a new tab)
Qwen3.7-MaxMMLU-Pro Original89.6%qwen.ai for Qwen3.7-Max on MMLU-Pro (opens in a new tab)
Claude Opus 4.7CyberGym Original73.1%anthropic.com for Claude Opus 4.7 on CyberGym (opens in a new tab)
Claude Opus 4.7MILU Original89.9%www-cdn.anthropic.com for Claude Opus 4.7 on Multi-task Indic Language Understanding Benchmark (opens in a new tab)
Claude Opus 4.7Global MMLU Original89.9%www-cdn.anthropic.com for Claude Opus 4.7 on Global MMLU (opens in a new tab)
Claude Opus 4.7Humanity's Last Exam Full set — With tools55.4%www-cdn.anthropic.com for Claude Opus 4.7 on Humanity's Last Exam (opens in a new tab)
Claude Opus 4.7Humanity's Last Exam Full set — With tools53.2%www-cdn.anthropic.com for Claude Opus 4.7 on Humanity's Last Exam (opens in a new tab)
Claude Opus 4.7Humanity's Last Exam Full set — With tools48.4%www-cdn.anthropic.com for Claude Opus 4.7 on Humanity's Last Exam (opens in a new tab)
Claude Opus 4.7Humanity's Last Exam Full set — With tools43.0%www-cdn.anthropic.com for Claude Opus 4.7 on Humanity's Last Exam (opens in a new tab)
Claude Opus 4.7CharXiv Reasoning — Python enabled91.0%www-cdn.anthropic.com for Claude Opus 4.7 on CharXiv (opens in a new tab)
Claude Opus 4.7CharXiv Reasoning — No tools82.1%www-cdn.anthropic.com for Claude Opus 4.7 on CharXiv (opens in a new tab)
Claude Opus 4.7MMMLU Original91.5%www-cdn.anthropic.com for Claude Opus 4.7 on MMMLU (opens in a new tab)
Qwen3.6-PlusMMMLU Original89.5%qwen.ai for Qwen3.6-Plus on MMMLU (opens in a new tab)
Qwen3.6-PlusAI2D TEST94.4%qwen.ai for Qwen3.6-Plus on AI2D (opens in a new tab)
Qwen3.6-PlusRealWorldQA Original85.4%qwen.ai for Qwen3.6-Plus on RealWorldQA (opens in a new tab)
Qwen3.6-PlusLongBench v262.0%qwen.ai for Qwen3.6-Plus on LongBench (opens in a new tab)
Claude Fable 5OSWorld Verified85.0%www-cdn.anthropic.com for Claude Fable 5 on OSWorld (opens in a new tab)
Claude Fable 5Terminal-Bench 2.1 — mini-swe-agent84.3%www-cdn.anthropic.com for Claude Fable 5 on Terminal-Bench (opens in a new tab)
Claude Fable 5SWE-bench Verified95.0%www-cdn.anthropic.com for Claude Fable 5 on SWE-bench (opens in a new tab)
DeepSeek-V4-ProToolathlon Original49.0%huggingface.co for DeepSeek-V4-Pro on Toolathlon (opens in a new tab)
DeepSeek-V4-ProToolathlon Original46.3%huggingface.co for DeepSeek-V4-Pro on Toolathlon (opens in a new tab)
DeepSeek-V4-FlashToolathlon Original43.5%huggingface.co for DeepSeek-V4-Flash on Toolathlon (opens in a new tab)
DeepSeek-V4-FlashToolathlon Original40.7%huggingface.co for DeepSeek-V4-Flash on Toolathlon (opens in a new tab)
DeepSeek-V4-ProBrowseComp80.4%huggingface.co for DeepSeek-V4-Pro on BrowseComp (opens in a new tab)
DeepSeek-V4-FlashBrowseComp53.5%huggingface.co for DeepSeek-V4-Flash on BrowseComp (opens in a new tab)
DeepSeek-V4-ProSWE-bench Multilingual74.1%huggingface.co for DeepSeek-V4-Pro on SWE-bench (opens in a new tab)
DeepSeek-V4-ProSWE-bench Multilingual69.8%huggingface.co for DeepSeek-V4-Pro on SWE-bench (opens in a new tab)
DeepSeek-V4-FlashSWE-bench Multilingual70.2%huggingface.co for DeepSeek-V4-Flash on SWE-bench (opens in a new tab)
DeepSeek-V4-FlashSWE-bench Multilingual69.7%huggingface.co for DeepSeek-V4-Flash on SWE-bench (opens in a new tab)
DeepSeek-V4-ProSWE-bench Verified79.4%huggingface.co for DeepSeek-V4-Pro on SWE-bench (opens in a new tab)
DeepSeek-V4-ProSWE-bench Verified73.6%huggingface.co for DeepSeek-V4-Pro on SWE-bench (opens in a new tab)
DeepSeek-V4-FlashSWE-bench Verified78.6%huggingface.co for DeepSeek-V4-Flash on SWE-bench (opens in a new tab)
DeepSeek-V4-FlashSWE-bench Verified73.7%huggingface.co for DeepSeek-V4-Flash on SWE-bench (opens in a new tab)
DeepSeek-V4-ProTerminal-Bench 2.063.3%huggingface.co for DeepSeek-V4-Pro on Terminal-Bench (opens in a new tab)
DeepSeek-V4-ProTerminal-Bench 2.059.1%huggingface.co for DeepSeek-V4-Pro on Terminal-Bench (opens in a new tab)
DeepSeek-V4-FlashTerminal-Bench 2.056.6%huggingface.co for DeepSeek-V4-Flash on Terminal-Bench (opens in a new tab)
DeepSeek-V4-FlashTerminal-Bench 2.049.1%huggingface.co for DeepSeek-V4-Flash on Terminal-Bench (opens in a new tab)
DeepSeek-V4-ProGPQA Diamond89.1%huggingface.co for DeepSeek-V4-Pro on Graduate-Level Google-Proof Q&A (opens in a new tab)
DeepSeek-V4-ProGPQA Diamond72.9%huggingface.co for DeepSeek-V4-Pro on Graduate-Level Google-Proof Q&A (opens in a new tab)
DeepSeek-V4-FlashGPQA Diamond87.4%huggingface.co for DeepSeek-V4-Flash on Graduate-Level Google-Proof Q&A (opens in a new tab)
DeepSeek-V4-FlashGPQA Diamond71.2%huggingface.co for DeepSeek-V4-Flash on Graduate-Level Google-Proof Q&A (opens in a new tab)
DeepSeek-V4-ProSimpleQA Verified Original57.9%huggingface.co for DeepSeek-V4-Pro on SimpleQA Verified (opens in a new tab)
DeepSeek-V4-ProSimpleQA Verified Original46.2%huggingface.co for DeepSeek-V4-Pro on SimpleQA Verified (opens in a new tab)
DeepSeek-V4-ProSimpleQA Verified Original45.0%huggingface.co for DeepSeek-V4-Pro on SimpleQA Verified (opens in a new tab)
DeepSeek-V4-FlashSimpleQA Verified Original34.1%huggingface.co for DeepSeek-V4-Flash on SimpleQA Verified (opens in a new tab)
DeepSeek-V4-FlashSimpleQA Verified Original28.9%huggingface.co for DeepSeek-V4-Flash on SimpleQA Verified (opens in a new tab)
DeepSeek-V4-FlashSimpleQA Verified Original23.1%huggingface.co for DeepSeek-V4-Flash on SimpleQA Verified (opens in a new tab)
DeepSeek-V4-ProMMLU-Pro Original87.5%huggingface.co for DeepSeek-V4-Pro on MMLU-Pro (opens in a new tab)
DeepSeek-V4-ProMMLU-Pro Original87.1%huggingface.co for DeepSeek-V4-Pro on MMLU-Pro (opens in a new tab)
DeepSeek-V4-ProMMLU-Pro Original82.9%huggingface.co for DeepSeek-V4-Pro on MMLU-Pro (opens in a new tab)
DeepSeek-V4-FlashMMLU-Pro Original86.2%huggingface.co for DeepSeek-V4-Flash on MMLU-Pro (opens in a new tab)
DeepSeek-V4-FlashMMLU-Pro Original86.4%huggingface.co for DeepSeek-V4-Flash on MMLU-Pro (opens in a new tab)
DeepSeek-V4-FlashMMLU-Pro Original83.0%huggingface.co for DeepSeek-V4-Flash on MMLU-Pro (opens in a new tab)
Composer 2.5SWE-bench Multilingual — Cursor strict harness71.6%cursor.com for Composer 2.5 on SWE-bench (opens in a new tab)
Composer 2.5SWE-bench Multilingual — Cursor standard harness79.2%cursor.com for Composer 2.5 on SWE-bench (opens in a new tab)
Muse SparkCyberGym Original43.5%ai.meta.com for Muse Spark on CyberGym (opens in a new tab)
Muse SparkFrontierScience Research38.3%ai.meta.com for Muse Spark on FrontierScience (opens in a new tab)
Muse SparkInternational Physics Olympiad 2025 Theory82.6%ai.meta.com for Muse Spark on International Physics Olympiad (opens in a new tab)
Muse SparkHumanity's Last Exam Full set — With tools58.4%ai.meta.com for Muse Spark on Humanity's Last Exam (opens in a new tab)
Muse SparkHumanity's Last Exam Full set — No tools50.2%ai.meta.com for Muse Spark on Humanity's Last Exam (opens in a new tab)
Muse SparkTerminal-Bench 2.059.0%ai.meta.com for Muse Spark on Terminal-Bench (opens in a new tab)
Muse SparkSWE-bench Pro Public52.4%ai.meta.com for Muse Spark on SWE-bench Pro (opens in a new tab)
Muse SparkSWE-bench Verified — Muse Spark corrected tests77.4%ai.meta.com for Muse Spark on SWE-bench (opens in a new tab)