Mathematical Reasoning on AIME'25 (Accuracy Avg@32)
59.69Accuracy (Avg@32)PPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| PPPOBackbone=Qwen3-8B, Evaluation Protocol=zero-shot, avg@322025.12 | 59.69 | |
| PPPOBackbone=Qwen3-4B, Evaluation Protocol=zero-shot, avg@322025.12 | 53.44 | |
| DAPO-FTBackbone=Qwen3-8B, Evaluation Protocol=zero-shot, avg@322025.12 | 49.38 | |
| DAPOBackbone=Qwen3-8B, Evaluation Protocol=zero-shot, avg@322025.12 | 48.75 | |
| GRPOBackbone=Qwen3-8B, Evaluation Protocol=zero-shot, avg@322025.12 | 42.29 | |
| DAPOBackbone=Qwen3-4B, Evaluation Protocol=zero-shot, avg@322025.12 | 42.08 | |
| DAPO-FTBackbone=Qwen3-4B, Evaluation Protocol=zero-shot, avg@322025.12 | 42.08 | |
| INTUITORBackbone=Qwen3-8B, Evaluation Protocol=zero-shot, avg@322025.12 | 40.83 | |
| Qwen3-8BBackbone=Qwen3-8B, Evaluation Protocol=zero-shot, avg@322025.12 | 38.75 | |
| GRPOBackbone=Qwen3-4B, Evaluation Protocol=zero-shot, avg@322025.12 | 37.71 | |
| Qwen3-4BBackbone=Qwen3-4B, Evaluation Protocol=zero-shot, avg@322025.12 | 35.42 | |
| INTUITORBackbone=Qwen3-4B, Evaluation Protocol=zero-shot, avg@322025.12 | 35.42 | |
| PPPOBackbone=Qwen3-1.7B, Evaluation Protocol=zero-shot, avg@322025.12 | 28.96 | |
| DAPO-FTBackbone=Qwen3-1.7B, Evaluation Protocol=zero-shot, avg@322025.12 | 23.96 | |
| DAPOBackbone=Qwen3-1.7B, Evaluation Protocol=zero-shot, avg@322025.12 | 23.33 | |
| GRPOBackbone=Qwen3-1.7B, Evaluation Protocol=zero-shot, avg@322025.12 | 20 | |
| Qwen3-1.7BBackbone=Qwen3-1.7B, Evaluation Protocol=zero-shot, avg@322025.12 | 18.33 | |
| INTUITORBackbone=Qwen3-1.7B, Evaluation Protocol=zero-shot, avg@322025.12 | 17.71 |