Mathematical Reasoning on AIME25 (Acc, Tok)
75.8AccuracyMulti-Agent Debate
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Multi-Agent DebateBase Model=Qwen3-32B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 75.8 | 157,744 | |
| Multi-Agent DebateBase Model=Qwen3-14B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 74.3 | 156,895 | |
| PACTBase Model=Qwen3-32B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 72.7 | 30,970 | |
| PACTBase Model=Qwen3-14B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 71.6 | 32,548 | |
| CoABase Model=Qwen3-32B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 71.2 | 35,818 | |
| Multi-Agent DebateBase Model=Qwen3-8B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 70.8 | 169,785 | |
| PACTBase Model=Qwen3-8B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 67.5 | 41,071 | |
| CoABase Model=Qwen3-14B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 64.5 | 35,807 | |
| CoABase Model=Qwen3-8B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 63.7 | 47,279 | |
| TextMASBase Model=Qwen3-14B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 60.8 | 44,111 | |
| TextMASBase Model=Qwen3-32B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 60.4 | 57,984 | |
| TextMASBase Model=Qwen3-8B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 45.8 | 45,004 |