Reasoning Episode Classification on Omni-MATH human-annotated Reasoning episodes (gold set)
86.33AccuracyGPT-5
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-5Model=GPT-52025.12 | 86.33 | 82.85 | |
| GPT-4.1Model=GPT-4.12025.12 | 86.1 | 82.74 | |
| GPT-5Model=GPT-52025.12 | 86.02 | 82.54 | |
| GPT-4.1Model=GPT-4.12025.12 | 85.75 | 82.39 | |
| Gemini-2.5-FlashModel=Gemini-2.5-Flash2025.12 | 82.9 | 78.67 | |
| Gemini-2.5-FlashModel=Gemini-2.5-Flash2025.12 | 82.45 | 78.21 | |
| Gemini-2.5-ProModel=Gemini-2.5-Pro2025.12 | 80.89 | 75.96 | |
| Gemini-2.5-ProModel=Gemini-2.5-Pro2025.12 | 80.53 | 75.6 |