Mathematical Reasoning on MinervaMath (Accuracy)
82.8AccuracyAgent 1 (Qwen3-30B-A3B-Instruct)
Evaluation Results
| Method | Links | |
|---|---|---|
| Agent 1 (Qwen3-30B-A3B-Instruct)Controller=Qwen2.5-7B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Qwen2.5-7B-Instruct, Agent 3=Qwen2.5-1.5B-Instruct2026.05 | 82.8 | |
| Agent 1 (Qwen3-30B-A3B-Instruct)Controller=Qwen3-4B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Ministral-3-8B-Instruct, Agent 3=Llama-3-2-1B-Instruct2026.05 | 82.8 | |
| Iterative Critique-and-Routing ControllerController=Qwen3-4B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Ministral-3-8B-Instruct, Agent 3=Llama-3-2-1B-Instruct2026.05 | 71.8 | |
| Iterative Critique-and-Routing ControllerController=Qwen2.5-7B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Qwen2.5-7B-Instruct, Agent 3=Qwen2.5-1.5B-Instruct2026.05 | 67.8 | |
| Agent 2 (Ministral-3-8B-Instruct)Controller=Qwen3-4B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Ministral-3-8B-Instruct, Agent 3=Llama-3-2-1B-Instruct2026.05 | 59.9 | |
| Random RouterController=Qwen2.5-7B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Qwen2.5-7B-Instruct, Agent 3=Qwen2.5-1.5B-Instruct2026.05 | 53.7 | |
| Random RouterController=Qwen3-4B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Ministral-3-8B-Instruct, Agent 3=Llama-3-2-1B-Instruct2026.05 | 52.8 | |
| Agent 2 (Qwen2.5-7B-Instruct)Controller=Qwen2.5-7B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Qwen2.5-7B-Instruct, Agent 3=Qwen2.5-1.5B-Instruct2026.05 | 52.4 | |
| Controller V1Controller=Qwen3-4B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Ministral-3-8B-Instruct, Agent 3=Llama-3-2-1B-Instruct2026.05 | 46 | |
| GAPGModel=LLaMA-3.2-3B2025.09 | 43.4 | |
| Router-R1Controller=Qwen2.5-7B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Qwen2.5-7B-Instruct, Agent 3=Qwen2.5-1.5B-Instruct2026.05 | 43.2 | |
| Controller V2Controller=Qwen2.5-7B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Qwen2.5-7B-Instruct, Agent 3=Qwen2.5-1.5B-Instruct2026.05 | 42.3 | |
| RouterDCController=Qwen2.5-7B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Qwen2.5-7B-Instruct, Agent 3=Qwen2.5-1.5B-Instruct2026.05 | 41.9 | |
| Controller V2Controller=Qwen3-4B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Ministral-3-8B-Instruct, Agent 3=Llama-3-2-1B-Instruct2026.05 | 41.9 | |
| RoBERTa RouterController=Qwen2.5-7B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Qwen2.5-7B-Instruct, Agent 3=Qwen2.5-1.5B-Instruct2026.05 | 41.7 | |
| GAPGModel=Qwen2.5-1.5B2025.09 | 40.8 | |
| Router-R1Controller=Qwen3-4B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Ministral-3-8B-Instruct, Agent 3=Llama-3-2-1B-Instruct2026.05 | 40.5 | |
| Router-R1Model=LLaMA-3.2-3B2025.09 | 39.7 | |
| RouterDCController=Qwen3-4B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Ministral-3-8B-Instruct, Agent 3=Llama-3-2-1B-Instruct2026.05 | 38.6 | |
| DAPO + HistaModel Size=14B, RL Algorithm=DAPO2026.05 | 38.5 | |
| DAPOModel Size=14B, RL Algorithm=DAPO2026.05 | 38.1 | |
| Router-R1Model=Qwen2.5-1.5B2025.09 | 37.8 | |
| RoBERTa RouterController=Qwen3-4B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Ministral-3-8B-Instruct, Agent 3=Llama-3-2-1B-Instruct2026.05 | 37.6 | |
| CSIPO + HistaModel Size=7B, RL Algorithm=CSIPO2026.05 | 34.2 | |
| DAPO + HistaModel Size=7B, RL Algorithm=DAPO2026.05 | 33.1 | |
| AutoMixModel=LLaMA-3.2-3B2025.09 | 32.7 | |
| DAPOModel Size=7B, RL Algorithm=DAPO2026.05 | 32.1 | |
| CSIPOModel Size=7B, RL Algorithm=CSIPO2026.05 | 31.3 | |
| CSIPOModel Size=3B, RL Algorithm=CSIPO2026.05 | 28.4 | |
| Agent 3 (Qwen2.5-1.5B-Instruct)Controller=Qwen2.5-7B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Qwen2.5-7B-Instruct, Agent 3=Qwen2.5-1.5B-Instruct2026.05 | 27.3 | |
| AugHard@8Training regime=Rewritten AugHard@8 subset2026.05 | 26.47 | |
| DAPOModel Size=3B, RL Algorithm=DAPO2026.05 | 25.8 | |
| CSIPO + HistaModel Size=3B, RL Algorithm=CSIPO2026.05 | 25.7 | |
| Full dataTraining regime=Full dataset2026.05 | 25.37 | |
| RFGOOptimization=Reasoning Feature-Guided Optimization2026.05 | 25 | |
| DAPO + HistaModel Size=3B, RL Algorithm=DAPO2026.05 | 24.9 | |
| Controller V1Controller=Qwen2.5-7B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Qwen2.5-7B-Instruct, Agent 3=Qwen2.5-1.5B-Instruct2026.05 | 24.7 | |
| AutoMixModel=Qwen2.5-1.5B2025.09 | 23.2 | |
| DAREModel=Qwen2.5-Math-1.5B, Decoding=greedy decoding2026.05 | 19.85 | |
| DAPO + HistaModel Size=1.5B, RL Algorithm=DAPO2026.05 | 19.4 | |
| CSIPOModel Size=1.5B, RL Algorithm=CSIPO2026.05 | 19.2 | |
| DAPOModel Size=1.5B, RL Algorithm=DAPO2026.05 | 18.8 | |
| CSIPO + HistaModel Size=1.5B, RL Algorithm=CSIPO2026.05 | 18 | |
| GSPO + HistaModel Size=1.5B, RL Algorithm=GSPO2026.05 | 17.9 | |
| GSPOModel Size=1.5B, RL Algorithm=GSPO2026.05 | 17.7 | |
| MoPPSModel=Qwen2.5-Math-1.5B, Decoding=greedy decoding2026.05 | 16.54 | |
| hard@8Training regime=hard@8 subset2026.05 | 15.81 | |
| DOTSModel=Qwen2.5-Math-1.5B, Decoding=greedy decoding2026.05 | 15.44 | |
| GRPOGroup Size G=162026.05 | 14.71 | |
| EDCOModel=Qwen2.5-Math-1.5B, Decoding=greedy decoding2026.05 | 13.6 | |
| GRPOModel=Qwen2.5-Math-1.5B, Decoding=greedy decoding2026.05 | 13.24 | |
| LLM-JudgeModel=Qwen2.5-Math-1.5B, Decoding=greedy decoding2026.05 | 13.24 | |
| Previous FR EstimationModel=Qwen2.5-Math-1.5B, Decoding=greedy decoding2026.05 | 13.24 | |
| GRPOGroup Size G=82026.05 | 13.24 | |
| BPPOGroup Size G=82026.05 | 13.24 | |
| BPPOGroup Size G=162026.05 | 13.24 | |
| GRPOGroup Size G=322026.05 | 12.5 | |
| BPPOGroup Size G=322026.05 | 12.13 | |
| Agent 3 (Llama-3-2-1B-Instruct)Controller=Qwen3-4B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Ministral-3-8B-Instruct, Agent 3=Llama-3-2-1B-Instruct2026.05 | 8.8 | |
| DAPO + HistaModel Size=0.5B, RL Algorithm=DAPO2026.05 | 6.4 | |
| DAPOModel Size=0.5B, RL Algorithm=DAPO2026.05 | 5.3 |