GPT-5.6 Sol · GPT-6 Sol

Shared benchmarks

3
Shared benchmarks for GPT-5.6 Sol and GPT-6 Sol
BenchmarkGPT-5.6 SolGPT-6 Sol
28.8%1.0.6 · Task pass rate
OpenAI
19.6%1.0.6 · Task pass rate
OpenAI
24.8%1.0.6 · Task pass rate
OpenAI
26.3%1.0.6 · Task pass rate
OpenAI
11.7%1.0.6 · Task pass rate
OpenAI
26.9%1.0.6 · Task pass rate
OpenAI
32.0%1.0.6 · Task pass rate
OpenAI
21.2%1.0.6 · Task pass rate
OpenAI
31.2%1.0.6 · Task pass rate
OpenAI
33.2%1.0.6 · Task pass rate
OpenAI
Evaluation details for AutomationBench 1.0.6

The recorded benchmark version, metric, and evaluator sets match. Evaluation methodology is not recorded by the registry.

GPT-5.6 Sol

GPT-6 Sol

DeepSWE 1.1Potentially non-equivalent: Evaluator sets differ.
73.0%1.1 · DeepSWE Pass@1
DataCurve
70.7%1.1 · DeepSWE Pass@1
OpenAI
72.7%1.1 · DeepSWE Pass@1
OpenAI
61.1%1.1 · DeepSWE Pass@1
OpenAI
69.4%1.1 · DeepSWE Pass@1
OpenAI
45.4%1.1 · DeepSWE Pass@1
OpenAI
66.6%1.1 · DeepSWE Pass@1
OpenAI
56.6%1.1 · DeepSWE Pass@1
OpenAI
68.8%1.1 · DeepSWE Pass@1
OpenAI
37.2%1.1 · DeepSWE Pass@1
OpenAI
65.3%1.1 · DeepSWE Pass@1
OpenAI
Potentially non-equivalent · Evaluation details for DeepSWE 1.1

Evaluator sets differ. Evaluation methodology is not recorded by the registry.

GPT-5.6 Sol

GPT-6 Sol

56.5%2.0 v2026.08.08 Offline — Partial · OSWorld Partial Score
OpenAI
66.2%2.0 v2026.08.08 Offline — Partial · OSWorld Partial Score
OpenAI
29.8%2.0 v2026.08.08 Offline — Partial · OSWorld Partial Score
OpenAI
49.7%2.0 v2026.08.08 Offline — Partial · OSWorld Partial Score
OpenAI
60.9%2.0 v2026.08.08 Offline — Partial · OSWorld Partial Score
OpenAI
60.5%2.0 v2026.08.08 Offline — Partial · OSWorld Partial Score
OpenAI
64.4%2.0 v2026.08.08 Offline — Partial · OSWorld Partial Score
OpenAI
54.0%2.0 v2026.08.08 Offline — Partial · OSWorld Partial Score
OpenAI
58.3%2.0 v2026.08.08 Offline — Partial · OSWorld Partial Score
OpenAI
43.9%2.0 v2026.08.08 Offline — Partial · OSWorld Partial Score
OpenAI
Evaluation details for OSWorld 2.0 v2026.08.08 Offline — Partial

The recorded benchmark version, metric, and evaluator sets match. Evaluation methodology is not recorded by the registry.

GPT-5.6 Sol

GPT-6 Sol