Mathematical Reasoning on DeepMind-Mathematics (Pass@1)
87.1Pass@1CoNL
Evaluation Results
| Method | Links | |
|---|---|---|
| CoNLBackbone=Qwen3-8B, Training Required=true2026.01 | 87.1 | |
| CoNLBackbone=Qwen3-4B-Instruct, Training Required=true2026.01 | 84.9 | |
| TrajFusionBase Model=DeepSeekMath-7B, Train Size=100k2026.02 | 69.6 | |
| Vanilla RFTBase Model=DeepSeekMath-7B, Train Size=100k2026.02 | 69.1 | |
| TrajFusionBase Model=DeepSeekMath-7B, Train Size=15k2026.02 | 66.8 | |
| MathFusionBase Model=DeepSeekMath-7B, Train Size=60k2026.02 | 65.8 | |
| Vanilla RFTBase Model=DeepSeekMath-7B, Train Size=15k2026.02 | 64.9 | |
| DARTMathBase Model=DeepSeekMath-7B, Train Size=590k2026.02 | 61.6 | |
| CoNLBackbone=Llama-3.1-8B, Training Required=true2026.01 | 57.5 | |
| CoNLBackbone=Llama-3.2-3B, Training Required=true2026.01 | 53.5 | |
| MMIQCBase Model=DeepSeekMath-7B, Train Size=2.3M2026.02 | 52.9 | |
| InstructBase Model=DeepSeekMath-7B, Train Size=780k2026.02 | 52.2 | |
| DARTMathBase Model=LLaMA3-8B, Train Size=590k2026.02 | 48 | |
| ICLBase Model=DeepSeekMath-7B2026.02 | 45.2 | |
| TrajFusionBase Model=LLaMA3-8B, Train Size=100k2026.02 | 43.7 | |
| MathFusionBase Model=LLaMA3-8B, Train Size=60k2026.02 | 43.4 | |
| Vanilla RFTBase Model=LLaMA3-8B, Train Size=100k2026.02 | 41.1 | |
| MMIQCBase Model=LLaMA3-8B, Train Size=2.3M2026.02 | 41 | |
| TrajFusionBase Model=LLaMA3-8B, Train Size=15k2026.02 | 37.9 | |
| MetaMathBase Model=LLaMA3-8B, Train Size=400k2026.02 | 35 | |
| Vanilla RFTBase Model=LLaMA3-8B, Train Size=15k2026.02 | 28.4 | |
| ICLBase Model=LLaMA3-8B2026.02 | 27.4 |