Scientific Question Answering on SuperGPQA*
62.4AccuracyGPT-5
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-5Reasoning Effort=High2025.08 | 62.4 | 3.8 | |
| Gemini-2.5-ProReasoning Effort=High2025.08 | 60.4 | 0.3 | |
| Gemini-2.5-ProReasoning Effort=Low2025.08 | 60.1 | — | |
| o3Reasoning Effort=High2025.08 | 59.5 | 4.6 | |
| GPT-5Reasoning Effort=Low2025.08 | 58.6 | — | |
| o4-miniReasoning Effort=High2025.08 | 57.1 | 8.5 | |
| o3Reasoning Effort=Low2025.08 | 54.9 | — | |
| o3-miniReasoning Effort=High2025.08 | 54 | 13.5 | |
| Claude-Sonnet-4Reasoning Effort=High2025.08 | 49.8 | 4.6 | |
| o4-miniReasoning Effort=Low2025.08 | 48.6 | — | |
| Claude-Sonnet-4Reasoning Effort=Low2025.08 | 45.2 | — | |
| o3-miniReasoning Effort=Low2025.08 | 40.5 | — |