Mathematical Reasoning on AIME'24 (accuracy avg@32)
72.19Accuracy (avg@32)PPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| PPPOBackbone=Qwen3-8B, Evaluation Protocol=zero-shot, avg@322025.12 | 72.19 | |
| DAPO-FTBackbone=Qwen3-8B, Evaluation Protocol=zero-shot, avg@322025.12 | 63.75 | |
| PPPOBackbone=Qwen3-4B, Evaluation Protocol=zero-shot, avg@322025.12 | 63.54 | |
| DAPOBackbone=Qwen3-8B, Evaluation Protocol=zero-shot, avg@322025.12 | 63.13 | |
| GRPOBackbone=Qwen3-8B, Evaluation Protocol=zero-shot, avg@322025.12 | 58.75 | |
| DAPOBackbone=Qwen3-4B, Evaluation Protocol=zero-shot, avg@322025.12 | 56.46 | |
| DAPO-FTBackbone=Qwen3-4B, Evaluation Protocol=zero-shot, avg@322025.12 | 56.25 | |
| INTUITORBackbone=Qwen3-8B, Evaluation Protocol=zero-shot, avg@322025.12 | 55.42 | |
| Qwen3-8BBackbone=Qwen3-8B, Evaluation Protocol=zero-shot, avg@322025.12 | 52.29 | |
| GRPOBackbone=Qwen3-4B, Evaluation Protocol=zero-shot, avg@322025.12 | 52.08 | |
| INTUITORBackbone=Qwen3-4B, Evaluation Protocol=zero-shot, avg@322025.12 | 51.04 | |
| Qwen3-4BBackbone=Qwen3-4B, Evaluation Protocol=zero-shot, avg@322025.12 | 48.75 | |
| PPPOBackbone=Qwen3-1.7B, Evaluation Protocol=zero-shot, avg@322025.12 | 38.65 | |
| DAPO-FTBackbone=Qwen3-1.7B, Evaluation Protocol=zero-shot, avg@322025.12 | 31.25 | |
| DAPOBackbone=Qwen3-1.7B, Evaluation Protocol=zero-shot, avg@322025.12 | 30.83 | |
| GRPOBackbone=Qwen3-1.7B, Evaluation Protocol=zero-shot, avg@322025.12 | 27.5 | |
| INTUITORBackbone=Qwen3-1.7B, Evaluation Protocol=zero-shot, avg@322025.12 | 27.29 | |
| Qwen3-1.7BBackbone=Qwen3-1.7B, Evaluation Protocol=zero-shot, avg@322025.12 | 25.83 |