Mathematical Reasoning on GSM8K (Accuracy@4 & GRPO Speedup)
93.9Accuracy (mean@4)DUET
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DUETBackbone=Qwen3-4B-base, Budget=Full2026.05 | 93.9 | 1.43 | |
| DUETBackbone=Qwen3-4B-base, Budget=50%2026.05 | 92.3 | 2.38 | |
| ARRoLBackbone=Qwen3-4B-base2026.05 | 90.3 | 1.19 | |
| GRPOBackbone=Qwen3-4B-base2026.05 | 90.1 | 1 | |
| VIPBackbone=Qwen3-4B-base2026.05 | 90.1 | 0.75 | |
| DAPOBackbone=Qwen3-4B-base2026.05 | 89.9 | 0.63 | |
| DUETBackbone=Qwen3-1.7B-base, Budget=Full2026.05 | 84.7 | 1.62 | |
| DUETBackbone=Qwen3-1.7B-base, Budget=50%2026.05 | 84 | 2.51 | |
| ARRoLBackbone=Qwen3-1.7B-base2026.05 | 79.6 | 1.3 | |
| VIPBackbone=Qwen3-1.7B-base2026.05 | 78.1 | 0.95 | |
| GRPOBackbone=Qwen3-1.7B-base2026.05 | 78 | 1 | |
| DAPOBackbone=Qwen3-1.7B-base2026.05 | 77.4 | 0.81 | |
| DUETBackbone=Llama-3.2-3B-Instruct, Budget=Full2026.05 | 75.9 | 1.26 | |
| GRPOBackbone=Llama-3.2-3B-Instruct2026.05 | 75.7 | 1 | |
| DAPOBackbone=Llama-3.2-3B-Instruct2026.05 | 75.5 | 0.82 | |
| VIPBackbone=Llama-3.2-3B-Instruct2026.05 | 75.2 | 0.95 | |
| ARRoLBackbone=Llama-3.2-3B-Instruct2026.05 | 74.8 | 1.13 | |
| DUETBackbone=Llama-3.2-3B-Instruct, Budget=50%2026.05 | 72.8 | 2.04 | |
| BaselineBackbone=Qwen3-1.7B-base2026.05 | 60.4 | — | |
| BaselineBackbone=Llama-3.2-3B-Instruct2026.05 | 60.3 | — | |
| BaselineBackbone=Qwen3-4B-base2026.05 | 58.5 | — |