Aggregate Reasoning on Average (Olympiad, MATH, AMC, AIME, GPQA)
69.2Average AccuracyDDPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DDPOBackbone=Qwen3-8B2026.03 | 69.2 | 5,970 | |
| GRPOBackbone=Qwen3-8B2026.03 | 68.55 | 7,416 | |
| DDPOBackbone=Qwen3-4B2026.03 | 68.03 | 5,866 | |
| DDPOBackbone=Qwen3-14B2026.03 | 67.34 | 5,560 | |
| L1Backbone=Qwen3-14B2026.03 | 66.66 | 6,357 | |
| GRPOBackbone=Qwen3-4B2026.03 | 66.54 | 7,370 | |
| GRPOBackbone=Qwen3-14B2026.03 | 65.49 | 6,324 | |
| SHORTER BETTERBackbone=Qwen3-14B2026.03 | 65.33 | 5,270 | |
| A-DLPBackbone=Qwen3-14B2026.03 | 65.12 | 5,536 | |
| GRPO-LEADBackbone=Qwen3-14B2026.03 | 64.86 | 6,603 |