Mathematical Reasoning on AIME 2024 and 2025 (test)
67.35Overall Performance RateAFlow + Unified-MAS
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| AFlow + Unified-MASTarget LLM=GPT-5-Mini2026.03 | 67.35 | — | — | — | 3.209 | |
| MAS² + Unified-MASTarget LLM=GPT-5-Mini2026.03 | 67.35 | — | — | — | 1.04 | |
| MAS² + Unified-MASTarget LLM=DeepSeek-V3.22026.03 | 66.67 | — | — | — | 0.884 | |
| MAS²Target LLM=GPT-5-Mini2026.03 | 63.27 | — | — | — | 1.133 | |
| ScoreFlow + Unified-MASTarget LLM=GPT-5-Mini2026.03 | 61.22 | — | — | — | 0.854 | |
| MAS-Zero + Unified-MASTarget LLM=GPT-5-Mini2026.03 | 59.18 | — | — | — | 19.351 | |
| AFlowTarget LLM=GPT-5-Mini2026.03 | 59.18 | — | — | — | 1.736 | |
| MAS-ZeroTarget LLM=GPT-5-Mini2026.03 | 57.14 | — | — | — | 30.546 | |
| ScoreFlowTarget LLM=GPT-5-Mini2026.03 | 57.14 | — | — | — | 0.701 | |
| ScoreFlow + Unified-MASTarget LLM=DeepSeek-V3.22026.03 | 57.14 | — | — | — | 0.462 | |
| VanillaTarget LLM=GPT-5-Mini2026.03 | 55.1 | — | — | — | 0.234 | |
| AFlow + Unified-MASTarget LLM=DeepSeek-V3.22026.03 | 55.1 | — | — | — | 0.718 | |
| MAS-Zero + Unified-MASTarget LLM=DeepSeek-V3.22026.03 | 53.06 | — | — | — | 8.899 | |
| MAS²Target LLM=DeepSeek-V3.22026.03 | 51.02 | — | — | — | 0.434 | |
| MAS-ZeroTarget LLM=DeepSeek-V3.22026.03 | 48.98 | — | — | — | 12.162 | |
| AFlowTarget LLM=DeepSeek-V3.22026.03 | 48.98 | — | — | — | 0.472 | |
| ScoreFlowTarget LLM=DeepSeek-V3.22026.03 | 44.9 | — | — | — | 0.305 | |
| VanillaTarget LLM=DeepSeek-V3.22026.03 | 42.86 | — | — | — | 0.063 | |
| GPT-4o-0513version=05132025.01 | — | — | 9.3 | — | — | |
| Qwen2-Math-7B-InstructBackbone=Qwen2-Math-7B2025.01 | — | — | 7.9 | 4.6 | — | |
| Qwen2-Math-7B-ZeroBackbone=Qwen2-Math-7B, Training=10,000 policy gradient update steps, Reinforcement Learning=Large-scale RL without distillation2025.01 | — | — | 22.3 | 18.1 | — |