General Multi-domain Reasoning on AIME, MMLU-Pro, MedMCQA, and GPQA
62.43Average ScoreSKILL-MOE
Evaluation Results
| Method | Links | |
|---|---|---|
| SKILL-MOECategory=Multi-Model Multi-Agent, Model=Adaptive2025.03 | 62.43 | |
| Self-Consistency (SC)Category=Advanced Single Model, Model=Task-Best x52025.03 | 58.72 | |
| Zero-Shot CoTCategory=Open-Source 30B+ Model, Model=QwenR1 32B2025.03 | 56.94 | |
| Zero-Shot CoTCategory=Open-Source 30B+ Model, Model=Qwen2.5 72B2025.03 | 54.28 | |
| Self-MoACategory=Single-Model Multi-Agent, Model=Task-Best x32025.03 | 54.28 | |
| ReConcileCategory=Multi-Model Multi-Agent, Model=Top-32025.03 | 53.8 | |
| Multi-Agent DebateCategory=Single-Model Multi-Agent, Model=Task-Best x32025.03 | 53.76 | |
| MoACategory=Multi-Model Multi-Agent, Model=Top-32025.03 | 53.76 | |
| Zero-Shot CoTCategory=Open-Source 7B Model, Model=Task-Best2025.03 | 53.62 | |
| Zero-Shot CoTCategory=Open-Source 30B+ Model, Model=Llama3.3 70B2025.03 | 53.18 | |
| Self-Refine (SR)Category=Advanced Single Model, Model=Task-Best2025.03 | 51.87 | |
| Zero-Shot CoTCategory=Open-Source 7B Model, Model=QwenR1 7B2025.03 | 48.04 |