Professional Multiple-discipline Knowledge on MMLU-Pro
71.54Accuracy (MMLU-Pro)Zero-Shot CoT
Evaluation Results
| Method | Links | |
|---|---|---|
| Zero-Shot CoTCategory=Open-Source 30B+ Model, Model=Qwen2.5 72B2025.03 | 71.54 | |
| Zero-Shot CoTCategory=Open-Source 30B+ Model, Model=Llama3.3 70B2025.03 | 69.26 | |
| Zero-Shot CoTCategory=Open-Source 30B+ Model, Model=QwenR1 32B2025.03 | 64.43 | |
| SKILL-MOECategory=Multi-Model Multi-Agent, Model=Adaptive2025.03 | 63.71 | |
| MoACategory=Multi-Model Multi-Agent, Model=Top-32025.03 | 61.78 | |
| Self-Consistency (SC)Category=Advanced Single Model, Model=Task-Best x52025.03 | 56.71 | |
| ReConcileCategory=Multi-Model Multi-Agent, Model=Top-32025.03 | 56.46 | |
| Multi-Agent DebateCategory=Single-Model Multi-Agent, Model=Task-Best x32025.03 | 56.21 | |
| Self-MoACategory=Single-Model Multi-Agent, Model=Task-Best x32025.03 | 55.43 | |
| Zero-Shot CoTCategory=Open-Source 7B Model, Model=Task-Best2025.03 | 54.89 | |
| Self-Refine (SR)Category=Advanced Single Model, Model=Task-Best2025.03 | 53.74 | |
| Zero-Shot CoTCategory=Open-Source 7B Model, Model=QwenR1 7B2025.03 | 52.57 |