Mathematical Reasoning on AMC12 (Accuracy)
74.69AccuracyUPFT
Evaluation Results
| Method | Links | |
|---|---|---|
| UPFTBackbone=Qwen3-14B2026.01 | 74.69 | |
| SFTBackbone=Qwen3-14B2026.01 | 73.26 | |
| P-ALIGNBackbone=Qwen3-14B2026.01 | 73.26 | |
| Zero-ShotBackbone=Qwen3-14B2026.01 | 72.29 | |
| MediumBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training=GRPO on Medium Difficulty Questions (tau=0.5)2026.01 | 57.8 | |
| Failure-Prefix ConditioningBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training=GRPO on Failure-Prefix Conditioned Data (tau=0.5)2026.01 | 56.3 | |
| BaseBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training=None2026.01 | 53.1 | |
| SaturateBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training=GRPO on Saturated Questions (No Prefix)2026.01 | 51.7 | |
| P-ALIGNBackbone=Llama3.2-3B2026.01 | 30.12 | |
| UPFTBackbone=Llama3.2-3B2026.01 | 26.5 | |
| SFT (Long-CoT)Backbone=Llama3.2-3B2026.01 | 20.19 | |
| Zero-ShotBackbone=Llama3.2-3B2026.01 | 18.81 |