Scientific Question Answering on MMLU-Pro
88.6AccuracyGPT-5
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GPT-5Reasoning Effort=High2025.08 | 88.6 | — | — | 2.1 | |
| o3Reasoning Effort=High2025.08 | 86.6 | — | — | 0.9 | |
| GPT-5Reasoning Effort=Low2025.08 | 86.5 | — | — | — | |
| Gemini-2.5-ProReasoning Effort=High2025.08 | 86.2 | — | — | 1.2 | |
| o4-miniReasoning Effort=High2025.08 | 86 | — | — | 1.9 | |
| o3Reasoning Effort=Low2025.08 | 85.7 | — | — | — | |
| Claude-Sonnet-4Reasoning Effort=High2025.08 | 85.3 | — | — | 1.2 | |
| o3-miniReasoning Effort=High2025.08 | 85 | — | — | 2.9 | |
| Gemini-2.5-ProReasoning Effort=Low2025.08 | 85 | — | — | — | |
| o4-miniReasoning Effort=Low2025.08 | 84.1 | — | — | — | |
| Claude-Sonnet-4Reasoning Effort=Low2025.08 | 84.1 | — | — | — | |
| o3-miniReasoning Effort=Low2025.08 | 82.1 | — | — | — | |
| OctoToolsBackbone=gpt-4o-2024-08-06, Modality=Text, Domain=Scientific, Visual Understanding=false, Numerical Calculation=false, Knowledge Retrieval=true, Multi-step Reasoning=true2025.02 | 73.7 | 2 | 3.4 | — | |
| 0-shotBackbone=gpt-4o-2024-08-06, Modality=Text, Domain=Scientific, Visual Understanding=false, Numerical Calculation=false, Knowledge Retrieval=true, Multi-step Reasoning=true2025.02 | 71.7 | — | — | — | |
| OctoToolsbaseBackbone=gpt-4o-2024-08-06, Modality=Text, Domain=Scientific, Visual Understanding=false, Numerical Calculation=false, Knowledge Retrieval=true, Multi-step Reasoning=true2025.02 | 71.5 | — | — | — | |
| CoTBackbone=gpt-4o-2024-08-06, Modality=Text, Domain=Scientific, Visual Understanding=false, Numerical Calculation=false, Knowledge Retrieval=true, Multi-step Reasoning=true2025.02 | 70.3 | — | — | — |