| 9.1%1.0.6 · Task pass rate OpenAI 12.9%1.0.6 · Task pass rate OpenAI 1.8%1.0.6 · Task pass rate OpenAI 4.3%1.0.6 · Task pass rate OpenAI 17.0%1.0.6 · Task pass rate OpenAI | 12.6%1.0.6 · Task pass rate OpenAI 14.5%1.0.6 · Task pass rate OpenAI 1.2%1.0.6 · Task pass rate OpenAI 9.4%1.0.6 · Task pass rate OpenAI 20.7%1.0.6 · Task pass rate OpenAI |
|---|
Evaluation details for AutomationBench 1.0.6The recorded benchmark version, metric, and evaluator sets match. Evaluation methodology is not recorded by the registry. GPT-5.6 Luna - Score
- 9.1%
- Evaluator
- OpenAI
- Metric
- Task pass rate (percent)
- Reasoning
- high
- Reported
- September 22, 2026
- Score
- 12.9%
- Evaluator
- OpenAI
- Metric
- Task pass rate (percent)
- Reasoning
- xhigh
- Reported
- September 22, 2026
- Score
- 1.8%
- Evaluator
- OpenAI
- Metric
- Task pass rate (percent)
- Reasoning
- low
- Reported
- September 22, 2026
- Score
- 4.3%
- Evaluator
- OpenAI
- Metric
- Task pass rate (percent)
- Reasoning
- medium
- Reported
- September 22, 2026
- Score
- 17.0%
- Evaluator
- OpenAI
- Metric
- Task pass rate (percent)
- Reasoning
- max
- Reported
- September 22, 2026
GPT-6 Luna - Score
- 12.6%
- Evaluator
- OpenAI
- Metric
- Task pass rate (percent)
- Reasoning
- xhigh
- Reported
- September 22, 2026
- Score
- 14.5%
- Evaluator
- OpenAI
- Metric
- Task pass rate (percent)
- Reasoning
- high
- Reported
- September 22, 2026
- Score
- 1.2%
- Evaluator
- OpenAI
- Metric
- Task pass rate (percent)
- Reasoning
- low
- Reported
- September 22, 2026
- Score
- 9.4%
- Evaluator
- OpenAI
- Metric
- Task pass rate (percent)
- Reasoning
- medium
- Reported
- September 22, 2026
- Score
- 20.7%
- Evaluator
- OpenAI
- Metric
- Task pass rate (percent)
- Reasoning
- max
- Reported
- September 22, 2026
|
| 9.3%1.1 · DeepSWE Pass@1 OpenAI 42.4%1.1 · DeepSWE Pass@1 OpenAI 62.2%1.1 · DeepSWE Pass@1 OpenAI 1.2%1.1 · DeepSWE Pass@1 OpenAI 56.2%1.1 · DeepSWE Pass@1 OpenAI 67.2%1.1 · DeepSWE Pass@1 OpenAI | 66.6%1.1 · DeepSWE Pass@1 OpenAI 59.3%1.1 · DeepSWE Pass@1 OpenAI 2.4%1.1 · DeepSWE Pass@1 OpenAI 61.3%1.1 · DeepSWE Pass@1 OpenAI 44.5%1.1 · DeepSWE Pass@1 OpenAI |
|---|
Evaluation details for DeepSWE 1.1The recorded benchmark version, metric, and evaluator sets match. Evaluation methodology is not recorded by the registry. GPT-5.6 Luna - Score
- 9.3%
- Evaluator
- OpenAI
- Metric
- DeepSWE Pass@1 (percent)
- Reasoning
- medium
- Reported
- September 22, 2026
- Score
- 42.4%
- Evaluator
- OpenAI
- Metric
- DeepSWE Pass@1 (percent)
- Reasoning
- high
- Reported
- September 22, 2026
- Score
- 62.2%
- Evaluator
- OpenAI
- Metric
- DeepSWE Pass@1 (percent)
- Reasoning
- max
- Reported
- September 22, 2026
- Score
- 1.2%
- Evaluator
- OpenAI
- Metric
- DeepSWE Pass@1 (percent)
- Reasoning
- low
- Reported
- September 22, 2026
- Score
- 56.2%
- Evaluator
- OpenAI
- Metric
- DeepSWE Pass@1 (percent)
- Reasoning
- xhigh
- Reported
- September 22, 2026
- Score
- 67.2%
- Evaluator
- OpenAI
- Metric
- DeepSWE Pass@1 (percent)
- Reasoning
- Not specified
- Reported
- July 9, 2026
GPT-6 Luna - Score
- 66.6%
- Evaluator
- OpenAI
- Metric
- DeepSWE Pass@1 (percent)
- Reasoning
- max
- Reported
- September 22, 2026
- Score
- 59.3%
- Evaluator
- OpenAI
- Metric
- DeepSWE Pass@1 (percent)
- Reasoning
- high
- Reported
- September 22, 2026
- Score
- 2.4%
- Evaluator
- OpenAI
- Metric
- DeepSWE Pass@1 (percent)
- Reasoning
- low
- Reported
- September 22, 2026
- Score
- 61.3%
- Evaluator
- OpenAI
- Metric
- DeepSWE Pass@1 (percent)
- Reasoning
- xhigh
- Reported
- September 22, 2026
- Score
- 44.5%
- Evaluator
- OpenAI
- Metric
- DeepSWE Pass@1 (percent)
- Reasoning
- medium
- Reported
- September 22, 2026
|
| 52.7%2.0 v2026.08.08 Offline — Partial · OSWorld Partial Score OpenAI 35.9%2.0 v2026.08.08 Offline — Partial · OSWorld Partial Score OpenAI 22.7%2.0 v2026.08.08 Offline — Partial · OSWorld Partial Score OpenAI 48.0%2.0 v2026.08.08 Offline — Partial · OSWorld Partial Score OpenAI 12.0%2.0 v2026.08.08 Offline — Partial · OSWorld Partial Score OpenAI | 46.7%2.0 v2026.08.08 Offline — Partial · OSWorld Partial Score OpenAI 31.5%2.0 v2026.08.08 Offline — Partial · OSWorld Partial Score OpenAI 52.7%2.0 v2026.08.08 Offline — Partial · OSWorld Partial Score OpenAI 41.4%2.0 v2026.08.08 Offline — Partial · OSWorld Partial Score OpenAI 8.3%2.0 v2026.08.08 Offline — Partial · OSWorld Partial Score OpenAI |
|---|
Evaluation details for OSWorld 2.0 v2026.08.08 Offline — PartialThe recorded benchmark version, metric, and evaluator sets match. Evaluation methodology is not recorded by the registry. GPT-5.6 Luna - Score
- 52.7%
- Evaluator
- OpenAI
- Metric
- OSWorld Partial Score (percent)
- Reasoning
- max
- Reported
- September 22, 2026
- Score
- 35.9%
- Evaluator
- OpenAI
- Metric
- OSWorld Partial Score (percent)
- Reasoning
- high
- Reported
- September 22, 2026
- Score
- 22.7%
- Evaluator
- OpenAI
- Metric
- OSWorld Partial Score (percent)
- Reasoning
- medium
- Reported
- September 22, 2026
- Score
- 48.0%
- Evaluator
- OpenAI
- Metric
- OSWorld Partial Score (percent)
- Reasoning
- xhigh
- Reported
- September 22, 2026
- Score
- 12.0%
- Evaluator
- OpenAI
- Metric
- OSWorld Partial Score (percent)
- Reasoning
- low
- Reported
- September 22, 2026
GPT-6 Luna - Score
- 46.7%
- Evaluator
- OpenAI
- Metric
- OSWorld Partial Score (percent)
- Reasoning
- xhigh
- Reported
- September 22, 2026
- Score
- 31.5%
- Evaluator
- OpenAI
- Metric
- OSWorld Partial Score (percent)
- Reasoning
- medium
- Reported
- September 22, 2026
- Score
- 52.7%
- Evaluator
- OpenAI
- Metric
- OSWorld Partial Score (percent)
- Reasoning
- max
- Reported
- September 22, 2026
- Score
- 41.4%
- Evaluator
- OpenAI
- Metric
- OSWorld Partial Score (percent)
- Reasoning
- high
- Reported
- September 22, 2026
- Score
- 8.3%
- Evaluator
- OpenAI
- Metric
- OSWorld Partial Score (percent)
- Reasoning
- low
- Reported
- September 22, 2026
|