Olympiad-level Science Problem Solving on OlympBench
69.6AccuracyGemini-2.5-Pro
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gemini-2.5-ProReasoning Effort=High2025.08 | 69.6 | 2.1 | |
| Gemini-2.5-ProReasoning Effort=Low2025.08 | 67.5 | — | |
| GPT-5Reasoning Effort=High2025.08 | 64.9 | 4.8 | |
| GPT-5Reasoning Effort=Low2025.08 | 60 | — | |
| Claude-Sonnet-4Reasoning Effort=High2025.08 | 59.8 | 4.4 | |
| o3Reasoning Effort=High2025.08 | 58 | 4.5 | |
| Claude-Sonnet-4Reasoning Effort=Low2025.08 | 55.4 | — | |
| o3Reasoning Effort=Low2025.08 | 53.5 | — | |
| o3-miniReasoning Effort=High2025.08 | 51.1 | 11.6 | |
| o4-miniReasoning Effort=High2025.08 | 49.6 | 9.2 | |
| o4-miniReasoning Effort=Low2025.08 | 40.4 | — | |
| o3-miniReasoning Effort=Low2025.08 | 39.5 | — |