Mathematical Reasoning on Olympiad (Avg@k, Pass@k)
46.78Avg@kRPSFT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RPSFTBackbone=Qwen2.5-7B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 46.78 | 61.78 | |
| SFTBackbone=Qwen2.5-7B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 43.44 | 59.55 | |
| IWBackbone=Qwen2.5-7B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 42.96 | 58.81 | |
| IWBackbone=Qwen2.5-7B-Instruct, RL Fine-tuning Stage=init2026.05 | 39.18 | 56.3 | |
| RPSFTBackbone=Qwen2.5-7B-Instruct, RL Fine-tuning Stage=init2026.05 | 38 | 56.15 | |
| SFTBackbone=Qwen2.5-7B-Instruct, RL Fine-tuning Stage=init2026.05 | 37.41 | 54.96 | |
| DFTBackbone=Qwen2.5-7B-Instruct, RL Fine-tuning Stage=init2026.05 | 37.41 | 50.07 | |
| DFTBackbone=Qwen2.5-7B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 36.81 | 48.59 | |
| RPSFTBackbone=Qwen2.5-3B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 29.04 | 46.67 | |
| RPSFTBackbone=Qwen2.5-3B-Instruct, RL Fine-tuning Stage=init2026.05 | 27.67 | 43.85 | |
| IWBackbone=Qwen2.5-3B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 27.59 | 42.66 | |
| SFTBackbone=Qwen2.5-3B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 27.44 | 44.44 | |
| RPSFTBackbone=Llama-3.1-8B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 27.03 | 43.7 | |
| SFTBackbone=Qwen2.5-3B-Instruct, RL Fine-tuning Stage=init2026.05 | 26.25 | 42.37 | |
| DFTBackbone=Llama-3.1-8B-Instruct, RL Fine-tuning Stage=init2026.05 | 26.22 | 26.22 | |
| IWBackbone=Qwen2.5-3B-Instruct, RL Fine-tuning Stage=init2026.05 | 26 | 42.67 | |
| IWBackbone=Llama-3.1-8B-Instruct, RL Fine-tuning Stage=init2026.05 | 25.71 | 41.63 | |
| SFTBackbone=Llama-3.1-8B-Instruct, RL Fine-tuning Stage=init2026.05 | 25.59 | 41.33 | |
| SFTBackbone=Llama-3.1-8B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 25.56 | 42.07 | |
| RPSFTBackbone=Llama-3.1-8B-Instruct, RL Fine-tuning Stage=init2026.05 | 25.52 | 42.22 | |
| IWBackbone=Llama-3.1-8B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 25.44 | 41.93 | |
| DFTBackbone=Qwen2.5-3B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 25.3 | 36.89 | |
| DFTBackbone=Qwen2.5-3B-Instruct, RL Fine-tuning Stage=init2026.05 | 25 | 38.37 | |
| DFTBackbone=Llama-3.1-8B-Instruct, RL Fine-tuning Stage=DAPO2026.05 | 17.41 | 28.44 |