Scientific Question Answering on GPQA (Accuracy (%), Δ)
82.4AccuracyGPT-5
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-5Reasoning Effort=High2025.08 | 82.4 | 3.1 | |
| Gemini-2.5-ProReasoning Effort=Low2025.08 | 80.1 | — | |
| o3Reasoning Effort=High2025.08 | 79.9 | 4.5 | |
| Gemini-2.5-ProReasoning Effort=High2025.08 | 79.5 | -0.6 | |
| GPT-5Reasoning Effort=Low2025.08 | 79.2 | — | |
| o3Reasoning Effort=Low2025.08 | 75.4 | — | |
| o4-miniReasoning Effort=High2025.08 | 74.6 | 5.2 | |
| o3-miniReasoning Effort=High2025.08 | 73.9 | 10.5 | |
| o4-miniReasoning Effort=Low2025.08 | 69.4 | — | |
| Claude-Sonnet-4Reasoning Effort=High2025.08 | 69 | 5.2 | |
| Claude-Sonnet-4Reasoning Effort=Low2025.08 | 63.8 | — | |
| o3-miniReasoning Effort=Low2025.08 | 63.4 | — |