Mathematical Reasoning on MATH 500-sample (test)
89.2Accuracy (avg@1)DAPO
Evaluation Results
| Method | Links | |
|---|---|---|
| DAPOBackbone=Qwen2.5-32B, Fine-tuning Protocol=Reinforcement fine-tuning2025.05 | 89.2 | |
| NFTBackbone=Qwen2.5-32B, Fine-tuning Protocol=Supervised fine-tuning2025.05 | 88.4 | |
| RFTBackbone=Qwen2.5-32B, Fine-tuning Protocol=Supervised fine-tuning2025.05 | 86.2 | |
| Dr. GRPOBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=Reinforcement fine-tuning2025.05 | 83.4 | |
| NFTBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=Supervised fine-tuning2025.05 | 83.2 | |
| DAPOBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=Reinforcement fine-tuning2025.05 | 81.6 | |
| GRPOBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=Reinforcement fine-tuning2025.05 | 80.4 | |
| DPOBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=Preference fine-tuning2025.05 | 79.8 | |
| RFTBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=Supervised fine-tuning2025.05 | 79.8 | |
| Qwen2.5-Math-7BBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=Base2025.05 | 69 | |
| Qwen2.5-32BBackbone=Qwen2.5-32B, Fine-tuning Protocol=Base2025.05 | 68.6 |