Multiple-choice Question Answering on MMLU-Pro (General Accuracy)
81.5Accuracy (MMLU-Pro)ARMOR-MAD
Evaluation Results
| Method | Links | |
|---|---|---|
| ARMOR-MADAgents=gpt-4o-mini, deepseek-v3, qwen-plus2026.06 | 81.5 | |
| MoA2026.06 | 79 | |
| Hetero-MADAgents=gpt-4o-mini, deepseek-v3, qwen-plus2026.06 | 76 | |
| Hetero-Vote-onlyAgents=gpt-4o-mini, deepseek-v3, qwen-plus2026.06 | 71.5 | |
| INFUSERAnchor Model=Qwen3-8B-Base2026.06 | 66.2 | |
| Self-ConsistencyAgents=gpt-4o-mini2026.06 | 66 | |
| SPICE†Anchor Model=Qwen3-8B-Base2026.06 | 65 | |
| R-Few†Anchor Model=Qwen3-8B-Base2026.06 | 63.2 | |
| AZRAnchor Model=Qwen3-8B-Base2026.06 | 62.32 | |
| R-ZeroAnchor Model=Qwen3-8B-Base2026.06 | 61.82 | |
| Single-CoTAgents=gpt-4o-mini2026.06 | 61.5 | |
| BaseAnchor Model=Qwen3-8B-Base2026.06 | 59.91 | |
| Homo-MADAgents=gpt-4o-mini2026.06 | 54 | |
| D-MAD2026.06 | 53.5 |