Multi-task Language Understanding on MMLU-Pro AceReason (Reduced)
71.1AccuracyModel-first Greedy
Evaluation Results
| Method | Links | |
|---|---|---|
| Model-first Greedyk=5, Summarizer=AceReason2026.05 | 71.1 | |
| Aya-judgek=5, Summarizer=AceReason2026.05 | 69.2 | |
| Input-allk=5, Summarizer=AceReason2026.05 | 68.7 | |
| MoAk=5, Summarizer=AceReason2026.05 | 68.7 | |
| Oracle-surrogate Greedyk=5, Summarizer=AceReason2026.05 | 68.7 | |
| Truth-prediction Greedyk=5, Summarizer=AceReason2026.05 | 67.8 | |
| Conditioned-diversityk=5, Summarizer=AceReason2026.05 | 66.9 | |
| Top-accuracyk=5, Summarizer=AceReason2026.05 | 66.6 | |
| Best-modelk=5, Summarizer=AceReason2026.05 | 66.4 | |
| GPT5.2-judgek=5, Summarizer=AceReason2026.05 | 56.8 |