Mathematical Reasoning on AIME24 (Avg@16, Avg)
67.5AIME24 Avg@16Teacher
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TeacherBackbone=QwQ-32B, Prompting=zero-shot2026.04 | 67.5 | 73.9 | |
| Self-ReSETBase Model=Qwen3-8B2026.05 | 62.3 | — | |
| RECAPBase Model=Qwen3-8B2026.05 | 62.1 | — | |
| BaseBase Model=Qwen3-8B2026.05 | 60 | — | |
| DAPOBase Model=Qwen3-8B2026.05 | 60 | — | |
| Self-ReSETBase Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 52.9 | — | |
| RECAPBase Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 52.1 | — | |
| BaseBase Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 51.9 | — | |
| DAPOBase Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 50.2 | — | |
| STAR-1Base Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 49 | — | |
| STAR-1Base Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 47.1 | — | |
| Self-ReSETBase Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 47.1 | — | |
| SafechainBase Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 46.5 | — | |
| DAPOBase Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 46.5 | — | |
| STAR-1Base Model=Qwen3-8B2026.05 | 46 | — | |
| BaseBase Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 44.4 | — | |
| RECAPBase Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 43.5 | — | |
| SafechainBase Model=Qwen3-8B2026.05 | 39 | — | |
| SafechainBase Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 37.5 | — | |
| Gen-SSDBackbone=Qwen2.5-Math-1.5B, Prompting=zero-shot, Chunk size=4K2026.04 | 10.21 | 34.94 | |
| MoRSDBackbone=Qwen2.5-Math-1.5B, Prompting=zero-shot2026.04 | 7.5 | 33.07 | |
| Standard KDBackbone=Qwen2.5-Math-1.5B, Prompting=zero-shot2026.04 | 7.08 | 29.01 | |
| MCC-KDBackbone=Qwen2.5-Math-1.5B, Prompting=zero-shot2026.04 | 5.63 | 30.25 | |
| StudentBackbone=Qwen2.5-Math-1.5B, Prompting=two-shot2026.04 | 3.33 | 15.54 | |
| Self-DistillationBackbone=Qwen2.5-Math-1.5B, Prompting=zero-shot2026.04 | 2.71 | 24.25 | |
| Cold StartBackbone=Qwen2.5-Math-1.5B, Prompting=zero-shot2026.04 | 0.42 | 18.3 |