Mathematical Reasoning on MATH level 5
84Success RateGradient Shift
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Gradient Shiftvariant=mult2026.01 | 84 | 26 | -0.41 | — | |
| Gradient Shiftvariant=hybrid2026.01 | 80 | 19 | -0.08 | — | |
| Weak-to-Strongalpha=2.0, k=402026.01 | 74 | 11 | 0.32 | — | |
| Weak-to-Strongalpha=1.5, k=402026.01 | 68 | 15 | 0 | — | |
| Weak-to-Strongalpha=1.0, k=402026.01 | 66 | 13 | 0.1 | — | |
| LC-ERD (Dual-72B)#Params=144B, VRAM (Avg.)=~112GB, Time (Rel.)=~2.1x, Multi-agent or MARL framework=true2026.05 | 61.4 | — | — | — | |
| LC-ERD (72B)#Params=72B, VRAM (Avg.)=~56GB, Time (Rel.)=~1.8x, Multi-agent or MARL framework=true2026.05 | 58.1 | — | — | — | |
| PRM#Params=72B+, VRAM (Avg.)=~64GB, Time (Rel.)=~1.6x, Multi-agent or MARL framework=true2026.05 | 51.9 | — | — | — | |
| Gradient Shiftvariant=add2026.01 | 51 | 11 | 0.02 | — | |
| MaAS#Params=72B+, VRAM (Avg.)=~60GB, Time (Rel.)=~2.1x, Multi-agent or MARL framework=true2026.05 | 49.2 | — | — | — | |
| InfiGUI-R1#Params=72B, VRAM (Avg.)=~63GB, Time (Rel.)=~1.3x, Multi-agent or MARL framework=true2026.05 | 46.8 | — | — | — | |
| AFlow#Params=72B+, VRAM (Avg.)=~64GB, Time (Rel.)=~3.2x, Multi-agent or MARL framework=true2026.05 | 46.7 | — | — | — | |
| Gen-Verifier#Params=72B, VRAM (Avg.)=~68GB, Time (Rel.)=~2.1x2026.05 | 45.2 | — | — | — | |
| LPO#Params=72B, VRAM (Avg.)=~52GB, Time (Rel.)=~1.5x2026.05 | 44.5 | — | — | — | |
| EndoRM#Params=72B, VRAM (Avg.)=~54GB, Time (Rel.)=~1.4x2026.05 | 44.1 | — | — | — | |
| STaR#Params=72B, VRAM (Avg.)=~58GB, Time (Rel.)=~2.5x, Multi-agent or MARL framework=true2026.05 | 43.8 | — | — | — | |
| SimPO#Params=72B, VRAM (Avg.)=~52GB, Time (Rel.)=~1.1x2026.05 | 41.8 | — | — | — | |
| Iterative-DPO#Params=72B, VRAM (Avg.)=~56GB, Time (Rel.)=~2.1x2026.05 | 41.5 | — | — | — | |
| DPO#Params=72B, VRAM (Avg.)=~52GB, Time (Rel.)=~1.8x2026.05 | 40.2 | — | — | — | |
| Qwen2.5-72B (Base)#Params=72B, VRAM (Avg.)=~52GB, Time (Rel.)=1.0x (SFT)2026.05 | 38.5 | — | — | — | |
| Benchmark LLM (BenchAcc)2026.01 | — | 22 | — | — | |
| Gemma-3-1B# Total Params=1B, # Trained Tokens=2T2025.11 | — | — | — | 14.64 | |
| Helper LLM2026.01 | — | 10 | — | — | |
| LFM2-1.2B# Total Params=1.2B, # Trained Tokens=11T2025.11 | — | — | — | 18.61 | |
| LFM2-350M# Total Params=0.35B, # Trained Tokens=11T2025.11 | — | — | — | 5.79 | |
| LFM2-700M# Total Params=0.70B, # Trained Tokens=11T2025.11 | — | — | — | 11.27 | |
| Llama-3.2-1B# Total Params=1.2B, # Trained Tokens=9T2025.11 | — | — | — | 14.2 | |
| Qwen3-0.6B# Total Params=0.6B, # Trained Tokens=36T2025.11 | — | — | — | 19.43 | |
| Qwen3-1.7B# Total Params=1.7B, # Trained Tokens=36T2025.11 | — | — | — | 36.99 |