Reasoning on AIME 24 (average score)
75.16AIME 24 Average ScoreREINFORCE++ (Ours)
Evaluation Results
| Method | Links | |
|---|---|---|
| REINFORCE++ (Ours)Base Model=Qwen3-8B, Training Paradigm=RL, Training Dataset=STAR-1 prompt distribution2025.12 | 75.16 | |
| Qwen3-8B + SFT (STAR-1)Base Model=Qwen3-8B, Training Paradigm=SFT, Training Dataset=STAR-12025.12 | 74.69 | |
| Qwen3-8B (thinking)Base Model=Qwen3-8B, Training Paradigm=Base, Evaluation Mode=thinking2025.12 | 74.22 | |
| Qwen3-8B + CPOBase Model=Qwen3-8B, Training Paradigm=CPO, Training Dataset=R2D-R12025.12 | 68.33 | |
| Qwen3-8B + SFT (SafeChain)Base Model=Qwen3-8B, Training Paradigm=SFT, Training Dataset=SafeChain2025.12 | 67.6 | |
| Qwen3-8B + SFT (R2D-R1)Base Model=Qwen3-8B, Training Paradigm=SFT, Training Dataset=R2D-R12025.12 | 60.05 | |
| REINFORCE++ (Ours)Base Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=RL, Training Dataset=STAR-1 prompt distribution2025.12 | 49.53 | |
| DeepSeek-R1-Distill-Qwen-7B + SFT (STAR-1)Base Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT, Training Dataset=STAR-12025.12 | 46.88 | |
| DeepSeek-R1-Distill-Qwen-7BBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=Base2025.12 | 46.3 | |
| DeepSeek-R1-Distill-Qwen-7B + SFT (SafeChain)Base Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT, Training Dataset=SafeChain2025.12 | 42.6 | |
| DeepSeek-R1-Distill-Qwen-7B + CPOBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=CPO, Training Dataset=R2D-R12025.12 | 41.67 | |
| DeepSeek-R1-Distill-Qwen-7B + SFT (R2D-R1)Base Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT, Training Dataset=R2D-R12025.12 | 39.64 |