Mathematical Reasoning on AMC23 (Avg@k, Pass@k)
62.19Avg@kRPSFT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RPSFTBackbone=Qwen2.5-7B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 62.19 | 95 | |
| IWBackbone=Qwen2.5-7B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 60 | 92.5 | |
| SFTBackbone=Qwen2.5-7B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 58.12 | 90 | |
| RPSFTBackbone=Qwen2.5-7B-Instruct, RL Fine-tuning Stage=init2026.05 | 55.31 | 90 | |
| DFTBackbone=Qwen2.5-7B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 53.13 | 82.5 | |
| IWBackbone=Qwen2.5-7B-Instruct, RL Fine-tuning Stage=init2026.05 | 52.5 | 85 | |
| SFTBackbone=Qwen2.5-7B-Instruct, RL Fine-tuning Stage=init2026.05 | 50.47 | 87.5 | |
| DFTBackbone=Qwen2.5-7B-Instruct, RL Fine-tuning Stage=init2026.05 | 48.91 | 82.5 | |
| IWBackbone=Qwen2.5-3B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 40.94 | 85 | |
| RPSFTBackbone=Qwen2.5-3B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 40 | 82.5 | |
| DFTBackbone=Qwen2.5-3B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 39.53 | 72.5 | |
| SFTBackbone=Qwen2.5-3B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 37.5 | 75 | |
| IWBackbone=Qwen2.5-3B-Instruct, RL Fine-tuning Stage=init2026.05 | 36.25 | 82.5 | |
| SFTBackbone=Qwen2.5-3B-Instruct, RL Fine-tuning Stage=init2026.05 | 35 | 82.5 | |
| RPSFTBackbone=Qwen2.5-3B-Instruct, RL Fine-tuning Stage=init2026.05 | 34.84 | 80 | |
| SFTBackbone=Llama-3.1-8B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 34.38 | 82.5 | |
| DFTBackbone=Qwen2.5-3B-Instruct, RL Fine-tuning Stage=init2026.05 | 34.06 | 77.5 | |
| IWBackbone=Llama-3.1-8B-Instruct, RL Fine-tuning Stage=init2026.05 | 33.59 | 80 | |
| RPSFTBackbone=Llama-3.1-8B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 33.59 | 85 | |
| IWBackbone=Llama-3.1-8B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 32.81 | 77.5 | |
| SFTBackbone=Llama-3.1-8B-Instruct, RL Fine-tuning Stage=init2026.05 | 32.19 | 77.5 | |
| RPSFTBackbone=Llama-3.1-8B-Instruct, RL Fine-tuning Stage=init2026.05 | 31.56 | 85 | |
| DFTBackbone=Llama-3.1-8B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 24.53 | 60 | |
| DFTBackbone=Llama-3.1-8B-Instruct, RL Fine-tuning Stage=init2026.05 | 19.53 | 62.5 |