Reasoning on MMLU (p-metrics evaluation)
92.2p_T ScoreO3
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| O32025.10 | 92.2 | 1 | 90.3 | 1 | -1.9 | 92.7 | 88.4 | 2 | |
| GPT-52025.10 | 92.2 | 1 | 86.7 | 2 | -5.5 | 92.5 | 84.8 | 3 | |
| O12025.10 | 91.1 | 2 | 90.3 | 1 | -0.7 | 96 | 89.2 | 1 | |
| DeepSeek-R12025.10 | 90.1 | 3 | 77.3 | 6 | -12.8 | 75.1 | 71.5 | 9 | |
| GPT-5-minisize=mini2025.10 | 89.3 | 4 | 79 | 5 | -10.3 | 84.3 | 75.3 | 6 | |
| GPT-4.1version=4.12025.10 | 88.7 | 5 | 73.2 | 9 | -15.6 | 95.3 | 72.1 | 8 | |
| Kimi-K22025.10 | 88.6 | 5 | 80.7 | 4 | -7.9 | 94 | 79.3 | 4 | |
| O4-minisize=mini2025.10 | 88.6 | 5 | 77.7 | 6 | -10.9 | 93.4 | 76.1 | 5 | |
| GPT-5-chatmode=chat2025.10 | 88.2 | 5 | 50.5 | 15 | -37.7 | 95.1 | 49.8 | 17 | |
| DeepSeek-V32025.10 | 86.6 | 6 | 73.8 | 8 | -12.8 | 86.7 | 70.8 | 10 | |
| GPT-4o2025.10 | 86.5 | 6 | 68.6 | 11 | -17.9 | 93.7 | 67.3 | 12 | |
| GPT-42025.10 | 86 | 7 | 75.8 | 7 | -10.2 | 93.7 | 74.4 | 7 | |
| GPT-5-nanosize=nano2025.10 | 85.8 | 7 | 62.4 | 13 | -23.4 | 43.3 | 51.8 | 16 | |
| Llama-3.3-Instparameters=70B2025.10 | 85.1 | 6 | 58.3 | 14 | -26.8 | 80.7 | 54.9 | 14 | |
| O3-minisize=mini2025.10 | 85 | 8 | 83.8 | 3 | -1.3 | 55 | 72.4 | 8 | |
| GPT-4.1-minisize=mini, version=4.12025.10 | 84.9 | 8 | 54.7 | 13 | -30.2 | 91 | 53.2 | 15 | |
| Qwen2.5-Instparameters=72B2025.10 | 84.4 | 8 | 64.8 | 12 | -19.7 | 64.7 | 57.9 | 13 | |
| Phi-42025.10 | 82 | 9 | 73.5 | 8 | -8.5 | 81.1 | 69.3 | 11 | |
| O1-minisize=mini2025.10 | 81.8 | 9 | 69.9 | 10 | -11.9 | 89 | 67.6 | 12 | |
| GPT-3.52025.10 | 67.7 | 10 | 35.2 | 17 | -32.4 | 65.4 | 31.6 | 19 | |
| Ministral-Instparameters=8B, version=24102025.10 | 62.3 | 11 | 41.3 | 16 | -20.9 | 59.3 | 36.3 | 18 |