Mathematical Reasoning on Minerva Math (Pass@1 accuracy)
32.63Pass@1 AccuracyQwen2.5-Math-7B w/ CADFT
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-Math-7B w/ CADFTBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=CADFT, Evaluation Protocol=Average@162026.04 | 32.63 | |
| DAPOBase Model=Qwen-2.5 Math-7B2026.06 | 30.5 | |
| Qwen2.5-Math-7B w/ DFTBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=DFT, Evaluation Protocol=Average@162026.04 | 30.16 | |
| DAPO (WITH FORKING TOKENS)Base Model=Qwen-2.5 Math-7B2026.06 | 30.1 | |
| PS-PPO (OPTIMIZED, B=128)Base Model=Qwen-2.5 Math-7B2026.06 | 30.1 | |
| DR.GRPOBase Model=Qwen-2.5 Math-7B2026.06 | 29.8 | |
| DAPOBase Model=Llama-3.1 8B-Instruct2026.06 | 29.4 | |
| GRPOBase Model=Qwen-2.5 Math-7B2026.06 | 29.4 | |
| DAPO (WITH FORKING TOKENS)Base Model=Llama-3.1 8B-Instruct2026.06 | 29.2 | |
| PS-PPO (OPTIMIZED, B=128)Base Model=Llama-3.1 8B-Instruct2026.06 | 29.2 | |
| Vanilla GRPOSetting=Outcome-Anchored2026.06 | 29.04 | |
| S-GRPOBase Model=Qwen-2.5 Math-7B2026.06 | 29 | |
| RLOOBase Model=Qwen-2.5 Math-7B2026.06 | 28.7 | |
| PS-PPO (UNIFORM)Base Model=Qwen-2.5 Math-7B2026.06 | 28.7 | |
| PUM+GRPOSetting=Outcome-Anchored2026.06 | 28.68 | |
| S-GRPOBase Model=Llama-3.1 8B-Instruct2026.06 | 28.6 | |
| DR.GRPOBase Model=Llama-3.1 8B-Instruct2026.06 | 28.3 | |
| FIXED LENGTH (L=512)Base Model=Qwen-2.5 Math-7B2026.06 | 28.3 | |
| GRPOBase Model=Llama-3.1 8B-Instruct2026.06 | 27.9 | |
| PS-PPO (HEURISTIC)Base Model=Qwen-2.5 Math-7B2026.06 | 27.9 | |
| PS-PPO (TIME-PRIOR)Base Model=Qwen-2.5 Math-7B2026.06 | 27.8 | |
| BASEBase Model=Qwen-2.5 Math-7B2026.06 | 27.6 | |
| PS-PPO (HEURISTIC)Base Model=Llama-3.1 8B-Instruct2026.06 | 27.1 | |
| PS-PPO (UNIFORM)Base Model=Llama-3.1 8B-Instruct2026.06 | 27 | |
| PS-PPO (TIME-PRIOR)Base Model=Llama-3.1 8B-Instruct2026.06 | 26.9 | |
| FIXED LENGTH (L=512)Base Model=Llama-3.1 8B-Instruct2026.06 | 26.7 | |
| PUMSetting=Process-Only2026.06 | 26.1 | |
| RLOOBase Model=Llama-3.1 8B-Instruct2026.06 | 26.1 | |
| BASEBase Model=Llama-3.1 8B-Instruct2026.06 | 25.7 | |
| PRM+GRPOSetting=Outcome-Anchored2026.06 | 25.37 | |
| Qwen2.5-Math-1.5B w/ CADFTBackbone=Qwen2.5-Math-1.5B, Fine-tuning Protocol=CADFT, Evaluation Protocol=Average@162026.04 | 22.8 | |
| Qwen2.5-Math-1.5B w/ DFTBackbone=Qwen2.5-Math-1.5B, Fine-tuning Protocol=DFT, Evaluation Protocol=Average@162026.04 | 20.94 | |
| PQMSetting=Process-Only2026.06 | 20.22 | |
| PQM+GRPOSetting=Outcome-Anchored2026.06 | 19.85 | |
| PRMSetting=Process-Only2026.06 | 18.75 | |
| DeepSeekMath-7B w/ CADFTBackbone=DeepSeekMath-7B, Fine-tuning Protocol=CADFT, Evaluation Protocol=Average@162026.04 | 18.1 | |
| DeepSeekMath-7B w/ DFTBackbone=DeepSeekMath-7B, Fine-tuning Protocol=DFT, Evaluation Protocol=Average@162026.04 | 16.79 | |
| Qwen2.5-Math-7B w/ SFTBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=SFT, Evaluation Protocol=Average@162026.04 | 16.66 | |
| Qwen2.5-Math-7BBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=None, Evaluation Protocol=Average@162026.04 | 14.39 | |
| Qwen2.5-Math-1.5B w/ SFTBackbone=Qwen2.5-Math-1.5B, Fine-tuning Protocol=SFT, Evaluation Protocol=Average@162026.04 | 13.04 | |
| LLaMA-3.1-8B w/ CADFTBackbone=LLaMA-3.1-8B, Fine-tuning Protocol=CADFT, Evaluation Protocol=Average@162026.04 | 9.4 | |
| Qwen2.5-Math-1.5BBackbone=Qwen2.5-Math-1.5B, Fine-tuning Protocol=None, Evaluation Protocol=Average@162026.04 | 8.51 | |
| LLaMA-3.1-8B w/ DFTBackbone=LLaMA-3.1-8B, Fine-tuning Protocol=DFT, Evaluation Protocol=Average@162026.04 | 8.26 | |
| DeepSeekMath-7B w/ SFTBackbone=DeepSeekMath-7B, Fine-tuning Protocol=SFT, Evaluation Protocol=Average@162026.04 | 7.26 | |
| LLaMA-3.1-8B w/ SFTBackbone=LLaMA-3.1-8B, Fine-tuning Protocol=SFT, Evaluation Protocol=Average@162026.04 | 5.78 | |
| LLaMA-3.2-3B w/ CADFTBackbone=LLaMA-3.2-3B, Fine-tuning Protocol=CADFT, Evaluation Protocol=Average@162026.04 | 3.2 | |
| LLaMA-3.2-3B w/ DFTBackbone=LLaMA-3.2-3B, Fine-tuning Protocol=DFT, Evaluation Protocol=Average@162026.04 | 2.84 | |
| LLaMA-3.2-3B w/ SFTBackbone=LLaMA-3.2-3B, Fine-tuning Protocol=SFT, Evaluation Protocol=Average@162026.04 | 2.38 | |
| DeepSeekMath-7BBackbone=DeepSeekMath-7B, Fine-tuning Protocol=None, Evaluation Protocol=Average@162026.04 | 2.15 | |
| LLaMA-3.2-3BBackbone=LLaMA-3.2-3B, Fine-tuning Protocol=None, Evaluation Protocol=Average@162026.04 | 1.36 | |
| LLaMA-3.1-8BBackbone=LLaMA-3.1-8B, Fine-tuning Protocol=None, Evaluation Protocol=Average@162026.04 | 0.98 |