Mathematical Reasoning on AMC23 (test)
92.2Pass@1SimPOShortest
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| SimPOShortestBackbone=Qwen3-8B2026.01 | 92.2 | 5,798 | 77.3 | — | — | — | |
| RELIEFBackbone=Qwen3-8B2026.01 | 89.3 | 5,093 | 67.9 | — | — | — | |
| OriginalBackbone=Qwen3-8B2026.01 | 89.1 | 7,496 | 100 | — | — | — | |
| SFTShortestBackbone=Qwen3-8B2026.01 | 88.8 | 7,304 | 97.4 | — | — | — | |
| BeliefPromptBackbone=Qwen3-8B2026.01 | 87.8 | 6,815 | 90.9 | — | — | — | |
| SFTbeliefBackbone=Qwen3-8B2026.01 | 85.9 | 7,274 | 97 | — | — | — | |
| RAgent-QwQ-32BReasoning Strategy=RAG Agent2025.01 | 85 | — | — | — | — | — | |
| Search-o1Reasoning Strategy=Reason-in-Documents2025.01 | 85 | — | — | — | — | — | |
| QwQ-32BReasoning Strategy=Direct Reasoning2025.01 | 82.5 | — | — | — | — | — | |
| RAG-QwQ-32BReasoning Strategy=Standard RAG2025.01 | 82.5 | — | — | — | — | — | |
| RELIEFBackbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 81.6 | 5,449 | 88.3 | — | — | — | |
| SimPOShortestBackbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 80.9 | 5,549 | 90 | — | — | — | |
| OriginalBackbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 79.1 | 6,169 | 100 | — | — | — | |
| BeliefPromptBackbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 78.8 | 5,936 | 96.2 | — | — | — | |
| SFTShortestBackbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 75 | 5,939 | 96.3 | — | — | — | |
| SFTbeliefBackbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 73.8 | 5,855 | 94.9 | — | — | — | |
| RAG-Qwen2.5-32BReasoning Strategy=Standard RAG2025.01 | 72.5 | — | — | — | — | — | |
| Qwen2.5-Coder-32BReasoning Strategy=Direct Reasoning2025.01 | 67.5 | — | — | — | — | — | |
| Qwen2.5-72BReasoning Strategy=Direct Reasoning2025.01 | 67.5 | — | — | — | — | — | |
| RAgent-Qwen2.5-32BReasoning Strategy=RAG Agent2025.01 | 65 | — | — | — | — | — | |
| DAPOModel Category=RL Post-Trained Models2026.05 | 65 | — | — | — | — | — | |
| GSPOModel Category=RL Post-Trained Models2026.05 | 62.5 | — | — | — | — | — | |
| HölderPOModel Category=RL Post-Trained Models, Schedule=Linear Des: 2 → −22026.05 | 60.2 | — | — | — | — | — | |
| GRPOModel Category=RL Post-Trained Models2026.05 | 60 | — | — | — | — | — | |
| Qwen2.5-32BReasoning Strategy=Direct Reasoning2025.01 | 57.5 | — | — | — | — | — | |
| FGOModel=ZR1-1.5B2026.02 | 55 | — | — | 540 | 10.2 | — | |
| FGOModel=Qwen2.5-Math-1.5B-Instruct2026.02 | 55 | — | — | 494 | 11.1 | — | |
| FGOModel=Qwen2.5-Math-1.5B2026.02 | 52.5 | — | — | 686 | 7.7 | — | |
| GRPOModel=Qwen2.5-Math-1.5B-Instruct2026.02 | 52.5 | — | — | 746 | 7 | — | |
| GRPOModel=Qwen2.5-Math-1.5B2026.02 | 50 | — | — | 825 | 6.1 | — | |
| VanillaModel=ZR1-1.5B2026.02 | 50 | — | — | 1,450 | 3.4 | — | |
| GRPOModel=ZR1-1.5B2026.02 | 50 | — | — | 1,453 | 3.4 | — | |
| Llama3.3-70BReasoning Strategy=Direct Reasoning2025.01 | 47.5 | — | — | — | — | — | |
| VanillaModel=Qwen2.5-Math-1.5B-Instruct2026.02 | 47.5 | — | — | 802 | 5.9 | — | |
| Qwen3-4B-BaseModel Category=Base Model2026.05 | 45 | — | — | — | — | — | |
| FGOModel=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 40 | — | — | 651 | 6.1 | — | |
| TLDRModel=Qwen2.5-Math-1.5B-Instruct2026.02 | 37.3 | — | — | 861 | 4.3 | — | |
| VanillaModel=Qwen2.5-Math-1.5B2026.02 | 30 | — | — | 978 | 3.1 | — | |
| GRPOModel=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 30 | — | — | 1,646 | 1.8 | — | |
| VanillaModel=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 27.5 | — | — | 1,820 | 1.5 | — | |
| UDSModel=Qwen-2.5-7B2025.10 | 26.38 | — | — | — | — | — | |
| GREATSModel=Qwen-2.5-7B2025.10 | 25.97 | — | — | — | — | — | |
| RHO-LossModel=Qwen-2.5-7B2025.10 | 25.59 | — | — | — | — | — | |
| RegularModel=Qwen-2.5-7B2025.10 | 24.67 | — | — | — | — | — | |
| RandomModel=Qwen-2.5-7B2025.10 | 24.39 | — | — | — | — | — | |
| MaxGradModel=Qwen-2.5-7B2025.10 | 24.26 | — | — | — | — | — | |
| MaxLossModel=Qwen-2.5-7B2025.10 | 23.89 | — | — | — | — | — | |
| TLDRModel=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 19.3 | — | — | 444 | 4.3 | — | |
| EndoRMBON=@64, Base Model=Llama3.2-1B, Training=SFT2026.04 | 10 | — | — | — | — | — | |
| DPO-RMBON=@64, Base Model=Llama3.2-1B, Training=SFT2026.04 | 10 | — | — | — | — | — | |
| Implicit PRMBON=@64, Base Model=Llama3.2-1B, Training=SFT2026.04 | 10 | — | — | — | — | — | |
| IPVRMBON=@64, Base Model=Llama3.2-1B, Training=SFT2026.04 | 10 | — | — | — | — | — | |
| Implicit PRMBON=AVG, Base Model=Llama3.2-1B, Training=SFT2026.04 | 6.7 | — | — | — | — | — | |
| IPVRMBON=AVG, Base Model=Llama3.2-1B, Training=SFT2026.04 | 6.7 | — | — | — | — | — | |
| DPO-RMBON=AVG, Base Model=Llama3.2-1B, Training=SFT2026.04 | 5.8 | — | — | — | — | — | |
| Q-RMBON=@4, Base Model=Llama3.2-1B, Training=SFT2026.04 | 5 | — | — | — | — | — | |
| DPO-RMBON=@4, Base Model=Llama3.2-1B, Training=SFT2026.04 | 5 | — | — | — | — | — | |
| Implicit PRMBON=@4, Base Model=Llama3.2-1B, Training=SFT2026.04 | 5 | — | — | — | — | — | |
| IPVRMBON=@4, Base Model=Llama3.2-1B, Training=SFT2026.04 | 5 | — | — | — | — | — | |
| Implicit PRMBON=@16, Base Model=Llama3.2-1B, Training=SFT2026.04 | 5 | — | — | — | — | — | |
| IPVRMBON=@16, Base Model=Llama3.2-1B, Training=SFT2026.04 | 5 | — | — | — | — | — | |
| Q-RMBON=@64, Base Model=Llama3.2-1B, Training=SFT2026.04 | 5 | — | — | — | — | — | |
| EndoRMBON=AVG, Base Model=Llama3.2-1B, Training=SFT2026.04 | 5 | — | — | — | — | — | |
| Q-RMBON=AVG, Base Model=Llama3.2-1B, Training=SFT2026.04 | 4.2 | — | — | — | — | — | |
| EndoRMBON=@4, Base Model=Llama3.2-1B, Training=SFT2026.04 | 2.5 | — | — | — | — | — | |
| Q-RMBON=@16, Base Model=Llama3.2-1B, Training=SFT2026.04 | 2.5 | — | — | — | — | — | |
| EndoRMBON=@16, Base Model=Llama3.2-1B, Training=SFT2026.04 | 2.5 | — | — | — | — | — | |
| DPO-RMBON=@16, Base Model=Llama3.2-1B, Training=SFT2026.04 | 2.5 | — | — | — | — | — | |
| CHORD-ϕShot Configuration=128-shot, RL on Gold Dataset (DE)=false2026.05 | — | — | — | — | — | 53.13 | |
| FEST-DPOShot Configuration=128-shot, RL on Gold Dataset (DE)=false2026.05 | — | — | — | — | — | 59.38 | |
| FEST-GRPOShot Configuration=128-shot, RL on Gold Dataset (DE)=false2026.05 | — | — | — | — | — | 57.81 | |
| HPTShot Configuration=128-shot, RL on Gold Dataset (DE)=false2026.05 | — | — | — | — | — | 55 | |
| HPT-GShot Configuration=128-shot, RL on Gold Dataset (DE)=true2026.05 | — | — | — | — | — | 46.88 | |
| LUFFYShot Configuration=128-shot, RL on Gold Dataset (DE)=false2026.05 | — | — | — | — | — | 55 | |
| ReLIFTShot Configuration=128-shot, RL on Gold Dataset (DE)=false2026.05 | — | — | — | — | — | 57.81 | |
| ReLIFT-GShot Configuration=128-shot, RL on Gold Dataset (DE)=true2026.05 | — | — | — | — | — | 54.06 | |
| RLShot Configuration=128-shot, RL on Gold Dataset (DE)=false2026.05 | — | — | — | — | — | 54.37 | |
| RL-GShot Configuration=128-shot, RL on Gold Dataset (DE)=true2026.05 | — | — | — | — | — | 57.5 | |
| SRFTShot Configuration=Full dataset, RL on Gold Dataset (DE)=false2026.05 | — | — | — | — | — | 51.25 |