Multi-agent Reasoning on MMLU
91.02AccuracySingle Best
Evaluation Results
| Method | Links | |
|---|---|---|
| Single BestEnsemble=GPT-4o-2024-11-20, Qwen2.5-Instruct-14B, Llama3.1-8B-Instruct, Phi-4, Oracle=true2025.10 | 91.02 | |
| OW-LEnsemble=GPT-4o-2024-11-20, Qwen2.5-Instruct-14B, Llama3.1-8B-Instruct, Phi-42025.10 | 90.37 | |
| OW-IEnsemble=GPT-4o-2024-11-20, Qwen2.5-Instruct-14B, Llama3.1-8B-Instruct, Phi-42025.10 | 90.37 | |
| ISPEnsemble=GPT-4o-2024-11-20, Qwen2.5-Instruct-14B, Llama3.1-8B-Instruct, Phi-42025.10 | 90.01 | |
| MVEnsemble=GPT-4o-2024-11-20, Qwen2.5-Instruct-14B, Llama3.1-8B-Instruct, Phi-42025.10 | 89.32 | |
| OW-IEnsemble Size=All Eight Models2025.10 | 88.64 | |
| OW-LEnsemble Size=All Eight Models2025.10 | 88.49 | |
| ISPEnsemble Size=All Eight Models2025.10 | 87.92 | |
| MVEnsemble Size=All Eight Models2025.10 | 87.19 |