Mathematical Reasoning on AIME 2025 (avg@10)
13.67Avg@10SCR (Ours)
Evaluation Results
| Method | Links | |
|---|---|---|
| SCR (Ours)Backbone=Qwen2.5-7B-Instruct2026.01 | 13.67 | |
| SFT + GRPOBackbone=Qwen2.5-7B-Instruct2026.01 | 11.67 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.01 | 10.33 | |
| SCR-Stage IBackbone=Qwen2.5-7B-Instruct2026.01 | 9 | |
| BaseBackbone=Qwen2.5-7B-Instruct2026.01 | 6 | |
| Self-RefineBackbone=Qwen2.5-7B-Instruct2026.01 | 5.67 | |
| GRPOBackbone=Qwen2.5-3B-Instruct2026.01 | 5 | |
| SCR (Ours)Backbone=Llama3.1-8B-Instruct2026.01 | 4.67 | |
| SCR-SFTBackbone=Qwen2.5-7B-Instruct2026.01 | 4 | |
| SCR (Ours)Backbone=Qwen2.5-3B-Instruct2026.01 | 4 | |
| SFT + GRPOBackbone=Qwen2.5-3B-Instruct2026.01 | 3.67 | |
| Self-RefineBackbone=Qwen2.5-3B-Instruct2026.01 | 3 | |
| BaseBackbone=Qwen2.5-3B-Instruct2026.01 | 2.33 | |
| SCR-SFTBackbone=Qwen2.5-3B-Instruct2026.01 | 2.33 | |
| SCR-Stage IBackbone=Qwen2.5-3B-Instruct2026.01 | 2 | |
| SCR-Stage IBackbone=Llama3.1-8B-Instruct2026.01 | 1.67 | |
| SCR-SFTBackbone=Llama3.1-8B-Instruct2026.01 | 1.33 | |
| GRPOBackbone=Llama3.1-8B-Instruct2026.01 | 1 | |
| SFT + GRPOBackbone=Llama3.1-8B-Instruct2026.01 | 0.67 | |
| BaseBackbone=Llama3.1-8B-Instruct2026.01 | 0 | |
| Self-RefineBackbone=Llama3.1-8B-Instruct2026.01 | 0 |