Reasoning on MATH500 (Average Score)
96.4MATH500 Average ScoreQwen3-8B (thinking)
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-8B (thinking)Base Model=Qwen3-8B, Training Paradigm=Base, Evaluation Mode=thinking2025.12 | 96.4 | |
| REINFORCE++ (Ours)Base Model=Qwen3-8B, Training Paradigm=RL, Training Dataset=STAR-1 prompt distribution2025.12 | 96.4 | |
| Qwen3-8B + CPOBase Model=Qwen3-8B, Training Paradigm=CPO, Training Dataset=R2D-R12025.12 | 95.55 | |
| Qwen3-8B + SFT (STAR-1)Base Model=Qwen3-8B, Training Paradigm=SFT, Training Dataset=STAR-12025.12 | 95.5 | |
| Qwen3-8B + SFT (SafeChain)Base Model=Qwen3-8B, Training Paradigm=SFT, Training Dataset=SafeChain2025.12 | 95 | |
| REINFORCE++ (Ours)Base Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=RL, Training Dataset=STAR-1 prompt distribution2025.12 | 92.3 | |
| DeepSeek-R1-Distill-Qwen-7BBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=Base2025.12 | 92 | |
| DeepSeek-R1-Distill-Qwen-7B + SFT (STAR-1)Base Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT, Training Dataset=STAR-12025.12 | 91.8 | |
| Qwen3-8B + SFT (R2D-R1)Base Model=Qwen3-8B, Training Paradigm=SFT, Training Dataset=R2D-R12025.12 | 91.7 | |
| DeepSeek-R1-Distill-Qwen-7B + SFT (SafeChain)Base Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT, Training Dataset=SafeChain2025.12 | 91.05 | |
| DeepSeek-R1-Distill-Qwen-7B + CPOBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=CPO, Training Dataset=R2D-R12025.12 | 90.75 | |
| DeepSeek-R1-Distill-Qwen-7B + SFT (R2D-R1)Base Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT, Training Dataset=R2D-R12025.12 | 86.8 |