Multi-task Language Understanding on MMLU-Pro AceReason (Complete)
76.5Accuracy (MMLU-Pro AceReason)Oracle-surrogate Greedy
Evaluation Results
| Method | Links | |
|---|---|---|
| Oracle-surrogate Greedyk=5, Summarizer=AceReason2026.05 | 76.5 | |
| Truth-prediction Greedyk=5, Summarizer=AceReason2026.05 | 75.5 | |
| Top-accuracyk=5, Summarizer=AceReason2026.05 | 74.6 | |
| Model-first Greedyk=5, Summarizer=AceReason2026.05 | 73.8 | |
| MoAk=5, Summarizer=AceReason2026.05 | 73.7 | |
| Input-allk=5, Summarizer=AceReason2026.05 | 72.4 | |
| Best-modelk=5, Summarizer=AceReason2026.05 | 72.2 | |
| Aya-judgek=5, Summarizer=AceReason2026.05 | 71 | |
| Conditioned-diversityk=5, Summarizer=AceReason2026.05 | 68.3 | |
| GPT5.2-judgek=5, Summarizer=AceReason2026.05 | 56.5 |