Mathematical Reasoning on AIME 2024 (avg@10)
15.33Avg@10 RecallSFT + GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| SFT + GRPOBackbone=Qwen2.5-7B-Instruct2026.01 | 15.33 | |
| SCR (Ours)Backbone=Qwen2.5-7B-Instruct2026.01 | 13.67 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.01 | 11.33 | |
| SCR-Stage IBackbone=Qwen2.5-7B-Instruct2026.01 | 11.33 | |
| BaseBackbone=Qwen2.5-7B-Instruct2026.01 | 11 | |
| Self-RefineBackbone=Qwen2.5-7B-Instruct2026.01 | 9.33 | |
| SCR-SFTBackbone=Qwen2.5-7B-Instruct2026.01 | 9.33 | |
| GRPOBackbone=Llama3.1-8B-Instruct2026.01 | 8.33 | |
| SFT + GRPOBackbone=Qwen2.5-3B-Instruct2026.01 | 7.33 | |
| SCR (Ours)Backbone=Qwen2.5-3B-Instruct2026.01 | 7.33 | |
| BaseBackbone=Qwen2.5-3B-Instruct2026.01 | 7 | |
| Self-RefineBackbone=Qwen2.5-3B-Instruct2026.01 | 6.67 | |
| GRPOBackbone=Qwen2.5-3B-Instruct2026.01 | 6 | |
| SFT + GRPOBackbone=Llama3.1-8B-Instruct2026.01 | 6 | |
| SCR (Ours)Backbone=Llama3.1-8B-Instruct2026.01 | 5.33 | |
| SCR-Stage IBackbone=Qwen2.5-3B-Instruct2026.01 | 4.33 | |
| SCR-Stage IBackbone=Llama3.1-8B-Instruct2026.01 | 4 | |
| SCR-SFTBackbone=Llama3.1-8B-Instruct2026.01 | 3 | |
| SCR-SFTBackbone=Qwen2.5-3B-Instruct2026.01 | 2.33 | |
| BaseBackbone=Llama3.1-8B-Instruct2026.01 | 2 | |
| Self-RefineBackbone=Llama3.1-8B-Instruct2026.01 | 2 |