Mathematical Reasoning on OlympiadBench (Acc, Tokens, EFF)
71.3AccuracyR1-distill+DR.SAF*
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| R1-distill+DR.SAF*Prompt=step, Backbone=Qwen3-8B2026.02 | 71.3 | 5,766 | 1.24 | |
| D-SFT->D-RL3k->D-RL6kPrompt=adaptive, Backbone=Qwen3-8B2026.02 | 69.19 | 6,849 | 1.01 | |
| R1-distill+Length-Penalty*Prompt=step, Backbone=Qwen3-8B2026.02 | 68.4 | 7,383 | 0.93 | |
| D-SFT->D-RL6kPrompt=adaptive, Backbone=Qwen3-8B2026.02 | 67.85 | 7,188 | 0.94 | |
| D-SFT->D-RL3k->D-RL6kPrompt=step, Backbone=Qwen3-8B2026.02 | 66.37 | 9,519 | 0.69 | |
| D-SFT->D-RL6kPrompt=step, Backbone=Qwen3-8B2026.02 | 66.37 | 9,170 | 0.72 | |
| ThinkPrune(6k->3k)Prompt=step, Backbone=Qwen3-8B2026.02 | 65.63 | 5,809 | 1.13 | |
| ThinkPrune(6k)Prompt=step, Backbone=Qwen3-8B2026.02 | 65.48 | 6,902 | 0.94 | |
| OriginalPrompt=step, Backbone=Qwen3-8B2026.02 | 64.44 | 11,887 | 0.54 | |
| R1-distill+FEDH*Prompt=step, Backbone=Qwen3-8B2026.02 | 63.5 | 12,353 | 0.51 | |
| D-SFT->D-RL6kPrompt=draft, Backbone=Qwen3-8B2026.02 | 63.41 | 4,340 | 1.46 | |
| D-SFT->D-RL3k->D-RL6kPrompt=draft, Backbone=Qwen3-8B2026.02 | 61.19 | 3,433 | 1.78 | |
| D-SFT->D-RL3kPrompt=draft, Backbone=Qwen3-8B2026.02 | 57.78 | 3,785 | 1.52 | |
| D-SFTPrompt=draft, Backbone=Qwen3-8B2026.02 | 36.89 | 3,535 | 1.04 |