Reasoning Episode Classification on Omni-MATH Non-Reasoning episodes (human-annotated gold set)
89.34AccuracyGPT-4.1
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-4.1Model=GPT-4.12025.12 | 89.34 | 85.36 | |
| GPT-5Model=GPT-52025.12 | 89.34 | 85.35 | |
| Gemini-2.5-FlashModel=Gemini-2.5-Flash2025.12 | 87.16 | 82.35 | |
| Gemini-2.5-ProModel=Gemini-2.5-Pro2025.12 | 84.43 | 78.62 |