Mathematical Reasoning on AIME 24 (Accuracy@4, GRPO Speedup)
18.3Accuracy (mean@4)DAPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DAPOBackbone=Qwen3-4B-base2026.05 | 18.3 | 0.63 | |
| VIPBackbone=Qwen3-4B-base2026.05 | 16.7 | 0.75 | |
| DUETBackbone=Qwen3-4B-base, Budget=Full2026.05 | 14.2 | 1.43 | |
| GRPOBackbone=Qwen3-4B-base2026.05 | 13.3 | 1 | |
| DUETBackbone=Qwen3-4B-base, Budget=50%2026.05 | 13.3 | 2.38 | |
| DUETBackbone=Qwen3-1.7B-base, Budget=Full2026.05 | 12.5 | 1.62 | |
| ARRoLBackbone=Qwen3-4B-base2026.05 | 11.7 | 1.19 | |
| DUETBackbone=Qwen3-1.7B-base, Budget=50%2026.05 | 10.8 | 2.51 | |
| BaselineBackbone=Qwen3-4B-base2026.05 | 10 | — | |
| VIPBackbone=Llama-3.2-3B-Instruct2026.05 | 9.2 | 0.95 | |
| ARRoLBackbone=Qwen3-1.7B-base2026.05 | 8.3 | 1.3 | |
| DAPOBackbone=Qwen3-1.7B-base2026.05 | 7.5 | 0.81 | |
| GRPOBackbone=Llama-3.2-3B-Instruct2026.05 | 7.5 | 1 | |
| DAPOBackbone=Llama-3.2-3B-Instruct2026.05 | 7.5 | 0.82 | |
| DUETBackbone=Llama-3.2-3B-Instruct, Budget=Full2026.05 | 7.5 | 1.26 | |
| GRPOBackbone=Qwen3-1.7B-base2026.05 | 6.7 | 1 | |
| ARRoLBackbone=Llama-3.2-3B-Instruct2026.05 | 6.7 | 1.13 | |
| DUETBackbone=Llama-3.2-3B-Instruct, Budget=50%2026.05 | 6.7 | 2.04 | |
| BaselineBackbone=Qwen3-1.7B-base2026.05 | 5.8 | — | |
| VIPBackbone=Qwen3-1.7B-base2026.05 | 5.8 | 0.95 | |
| BaselineBackbone=Llama-3.2-3B-Instruct2026.05 | 3.3 | — |