Mathematical Reasoning on OlympiadBench v1 (test)
55Accuracy (avg@1)NFT
Evaluation Results
| Method | Links | |
|---|---|---|
| NFTBackbone=Qwen2.5-32B, Fine-tuning Protocol=Supervised fine-tuning2025.05 | 55 | |
| DAPOBackbone=Qwen2.5-32B, Fine-tuning Protocol=Reinforcement fine-tuning2025.05 | 54.1 | |
| GRPOBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=Reinforcement fine-tuning2025.05 | 51.8 | |
| DAPOBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=Reinforcement fine-tuning2025.05 | 49.9 | |
| Dr. GRPOBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=Reinforcement fine-tuning2025.05 | 49.6 | |
| DPOBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=Preference fine-tuning2025.05 | 48 | |
| NFTBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=Supervised fine-tuning2025.05 | 47.3 | |
| RFTBackbone=Qwen2.5-32B, Fine-tuning Protocol=Supervised fine-tuning2025.05 | 45.3 | |
| RFTBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=Supervised fine-tuning2025.05 | 44.3 | |
| Qwen2.5-Math-7BBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=Base2025.05 | 34.7 | |
| Qwen2.5-32BBackbone=Qwen2.5-32B, Fine-tuning Protocol=Base2025.05 | 31.1 |