Reasoning on AIME 25 (average score)
44.11Average ScoreREINFORCE++ (Ours)
Evaluation Results
| Method | Links | |
|---|---|---|
| REINFORCE++ (Ours)Base Model=Qwen3-8B, Training Paradigm=RL, Training Dataset=STAR-1 prompt distribution2025.12 | 44.11 | |
| Qwen3-8B + SFT (STAR-1)Base Model=Qwen3-8B, Training Paradigm=SFT, Training Dataset=STAR-12025.12 | 42.55 | |
| Qwen3-8B + CPOBase Model=Qwen3-8B, Training Paradigm=CPO, Training Dataset=R2D-R12025.12 | 42.29 | |
| Qwen3-8B (thinking)Base Model=Qwen3-8B, Training Paradigm=Base, Evaluation Mode=thinking2025.12 | 40.57 | |
| Qwen3-8B + SFT (SafeChain)Base Model=Qwen3-8B, Training Paradigm=SFT, Training Dataset=SafeChain2025.12 | 39.06 | |
| Qwen3-8B + SFT (R2D-R1)Base Model=Qwen3-8B, Training Paradigm=SFT, Training Dataset=R2D-R12025.12 | 36.04 | |
| REINFORCE++ (Ours)Base Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=RL, Training Dataset=STAR-1 prompt distribution2025.12 | 32.14 | |
| DeepSeek-R1-Distill-Qwen-7B + SFT (STAR-1)Base Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT, Training Dataset=STAR-12025.12 | 31.87 | |
| DeepSeek-R1-Distill-Qwen-7BBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=Base2025.12 | 30.52 | |
| DeepSeek-R1-Distill-Qwen-7B + SFT (R2D-R1)Base Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT, Training Dataset=R2D-R12025.12 | 29.38 | |
| DeepSeek-R1-Distill-Qwen-7B + SFT (SafeChain)Base Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT, Training Dataset=SafeChain2025.12 | 28.64 | |
| DeepSeek-R1-Distill-Qwen-7B + CPOBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=CPO, Training Dataset=R2D-R12025.12 | 27.86 |