Mathematical Reasoning on AIME 2025 (Acc, Tokens, EFF)
64.79AccuracyD-SFT->D-RL3k->D-RL6k
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| D-SFT->D-RL3k->D-RL6kPrompt=step, Backbone=Qwen3-8B2026.02 | 64.79 | 14,112 | 0.46 | |
| REO-RL(Q-Spec)*Prompt=step, Backbone=Qwen3-8B2026.02 | 64.4 | 12,645 | 0.51 | |
| OriginalPrompt=step, Backbone=Qwen3-8B2026.02 | 64.38 | 18,034 | 0.36 | |
| D-SFT->D-RL6kPrompt=step, Backbone=Qwen3-8B2026.02 | 63.54 | 13,760 | 0.46 | |
| D-SFT->D-RL6kPrompt=adaptive, Backbone=Qwen3-8B2026.02 | 61.88 | 12,115 | 0.51 | |
| R1-distill+DR.SAF*Prompt=step, Backbone=Qwen3-8B2026.02 | 57.9 | 10,692 | 0.54 | |
| D-SFT->D-RL3k->D-RL6kPrompt=adaptive, Backbone=Qwen3-8B2026.02 | 56.67 | 12,155 | 0.46 | |
| R1-distill+Length-Penalty*Prompt=step, Backbone=Qwen3-8B2026.02 | 54.7 | 12,446 | 0.44 | |
| ThinkPrune(6k)Prompt=step, Backbone=Qwen3-8B2026.02 | 53.96 | 11,720 | 0.46 | |
| D-SFT->D-RL6kPrompt=draft, Backbone=Qwen3-8B2026.02 | 48.75 | 7,426 | 0.65 | |
| ThinkPrune(6k->3k)Prompt=step, Backbone=Qwen3-8B2026.02 | 48.13 | 9,781 | 0.49 | |
| R1-distill+FEDH*Prompt=step, Backbone=Qwen3-8B2026.02 | 46.7 | 14,730 | 0.32 | |
| D-SFT->D-RL3k->D-RL6kPrompt=draft, Backbone=Qwen3-8B2026.02 | 45.42 | 6,527 | 0.69 | |
| D-SFT->D-RL3kPrompt=draft, Backbone=Qwen3-8B2026.02 | 43.96 | 6,100 | 0.72 | |
| D-SFTPrompt=draft, Backbone=Qwen3-8B2026.02 | 9.17 | 3,928 | 0.23 |