Mathematical Reasoning on AIME 25 (Accuracy, Average Tokens)
30.4AccuracyGRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPOBackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 30.4 | 8,279 | |
| CODABackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 30.4 | 8,050 | |
| VLPBackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 27.9 | 7,546 | |
| ASRRBackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 25.8 | 7,659 | |
| CODABackbone=Qwen3-8B, Sampling Strategy=mean@82026.03 | 22.9 | 7,275 | |
| GRPOBackbone=Qwen3-8B, Sampling Strategy=mean@82026.03 | 22.1 | 7,389 | |
| CODABackbone=Qwen3-4B, Sampling Strategy=mean@82026.03 | 20.8 | 8,650 | |
| VLPBackbone=Qwen3-8B, Sampling Strategy=mean@82026.03 | 20.8 | 6,247 | |
| GRPOBackbone=Qwen3-4B, Sampling Strategy=mean@82026.03 | 19.6 | 9,391 | |
| ASRRBackbone=Qwen3-8B, Sampling Strategy=mean@82026.03 | 18.8 | 5,950 | |
| ASRRBackbone=Qwen3-4B, Sampling Strategy=mean@82026.03 | 17.9 | 6,315 | |
| VLPBackbone=Qwen3-4B, Sampling Strategy=mean@82026.03 | 17.5 | 6,298 | |
| Qwen3-14B-BaseBackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 10.4 | 2,610 | |
| Qwen3-8B-BaseBackbone=Qwen3-8B, Sampling Strategy=mean@82026.03 | 9.6 | 1,783 | |
| Qwen3-4B-BaseBackbone=Qwen3-4B, Sampling Strategy=mean@82026.03 | 4.2 | 2,008 |