Mathematical Reasoning on AIME 2025 (Acc, ARI, ABO, AIRW)
80.6AccuracyStandard CoT (RL Final)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Standard CoT (RL Final)Backbone=Qwen3-30B-A3B, Training Stage=RL Final2026.05 | 80.6 | 16,995 | 16,709 | 16,709 | |
| SxS Interleaved (RL Final)Backbone=Qwen3-4B, Training Stage=RL Final2026.05 | 80 | 17,981 | 17,818 | 8,519 | |
| SxS Interleaved (RL Final)Backbone=Qwen3-30B-A3B, Training Stage=RL Final2026.05 | 79.2 | 16,375 | 16,322 | 13,829 | |
| Standard CoT (SFT)Backbone=Qwen3-30B-A3B, Training Stage=SFT2026.05 | 76.9 | 17,287 | 16,958 | 16,958 | |
| SxS Interleaved (RL Recovery)Backbone=Qwen3-30B-A3B, Training Stage=RL Recovery2026.05 | 76 | 14,132 | 14,043 | 8,619 | |
| Base ModelBackbone=Qwen3-30B-A3B2026.05 | 74 | 16,942 | 16,942 | 16,942 | |
| Standard CoT (RL Final)Backbone=Qwen3-4B, Training Stage=RL Final2026.05 | 73.8 | 21,580 | 21,316 | 21,316 | |
| SxS Interleaved (RL Recovery)Backbone=Qwen3-4B, Training Stage=RL Recovery2026.05 | 69.4 | 14,744 | 14,981 | 6,641 | |
| Base ModelBackbone=Qwen3-4B2026.05 | 66.3 | 17,862 | 17,339 | 17,339 | |
| Standard CoT (SFT)Backbone=Qwen3-4B, Training Stage=SFT2026.05 | 62.9 | 20,807 | 20,542 | 20,542 | |
| SxS Interleaved (SFT)Backbone=Qwen3-30B-A3B, Training Stage=SFT2026.05 | 50.8 | 7,540 | 8,819 | 3,522 | |
| SxS Interleaved (SFT)Backbone=Qwen3-4B, Training Stage=SFT2026.05 | 38.3 | 8,002 | 9,619 | 4,035 |