Mathematical Reasoning on AMC (avg@10)
50.84Avg@10 ScoreSFT + GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| SFT + GRPOBackbone=Qwen2.5-7B-Instruct2026.01 | 50.84 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.01 | 50.6 | |
| SCR (Ours)Backbone=Qwen2.5-7B-Instruct2026.01 | 50.12 | |
| SCR-Stage IBackbone=Qwen2.5-7B-Instruct2026.01 | 44.46 | |
| BaseBackbone=Qwen2.5-7B-Instruct2026.01 | 42.05 | |
| Self-RefineBackbone=Qwen2.5-7B-Instruct2026.01 | 38.67 | |
| SCR (Ours)Backbone=Qwen2.5-3B-Instruct2026.01 | 36.02 | |
| GRPOBackbone=Qwen2.5-3B-Instruct2026.01 | 35.9 | |
| SCR-SFTBackbone=Qwen2.5-7B-Instruct2026.01 | 35.18 | |
| SFT + GRPOBackbone=Qwen2.5-3B-Instruct2026.01 | 35.06 | |
| Self-RefineBackbone=Qwen2.5-3B-Instruct2026.01 | 29.52 | |
| SCR-Stage IBackbone=Qwen2.5-3B-Instruct2026.01 | 29.16 | |
| SFT + GRPOBackbone=Llama3.1-8B-Instruct2026.01 | 28.67 | |
| BaseBackbone=Qwen2.5-3B-Instruct2026.01 | 27.95 | |
| SCR-Stage IBackbone=Llama3.1-8B-Instruct2026.01 | 26.51 | |
| SCR (Ours)Backbone=Llama3.1-8B-Instruct2026.01 | 24.46 | |
| GRPOBackbone=Llama3.1-8B-Instruct2026.01 | 24.22 | |
| SCR-SFTBackbone=Qwen2.5-3B-Instruct2026.01 | 23.86 | |
| SCR-SFTBackbone=Llama3.1-8B-Instruct2026.01 | 19.04 | |
| BaseBackbone=Llama3.1-8B-Instruct2026.01 | 12.77 | |
| Self-RefineBackbone=Llama3.1-8B-Instruct2026.01 | 7.23 |