Safety on AIR-Bench
0.66Average ScoreREINFORCE++ (Ours)
Evaluation Results
| Method | Links | |
|---|---|---|
| REINFORCE++ (Ours)Base Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=RL, Training Dataset=STAR-1 prompt distribution2025.12 | 0.66 | |
| DeepSeek-R1-Distill-Qwen-7B + SFT (STAR-1)Base Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT, Training Dataset=STAR-12025.12 | 0.59 | |
| REINFORCE++ (Ours)Base Model=Qwen3-8B, Training Paradigm=RL, Training Dataset=STAR-1 prompt distribution2025.12 | 0.58 | |
| Qwen3-8B + CPOBase Model=Qwen3-8B, Training Paradigm=CPO, Training Dataset=R2D-R12025.12 | 0.55 | |
| Qwen3-8B + SFT (STAR-1)Base Model=Qwen3-8B, Training Paradigm=SFT, Training Dataset=STAR-12025.12 | 0.51 | |
| Qwen3-8B + SFT (R2D-R1)Base Model=Qwen3-8B, Training Paradigm=SFT, Training Dataset=R2D-R12025.12 | 0.43 | |
| DeepSeek-R1-Distill-Qwen-7B + SFT (R2D-R1)Base Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT, Training Dataset=R2D-R12025.12 | 0.41 | |
| DeepSeek-R1-Distill-Qwen-7B + CPOBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=CPO, Training Dataset=R2D-R12025.12 | 0.41 | |
| Qwen3-8B (thinking)Base Model=Qwen3-8B, Training Paradigm=Base, Evaluation Mode=thinking2025.12 | 0.4 | |
| Qwen3-8B + SFT (SafeChain)Base Model=Qwen3-8B, Training Paradigm=SFT, Training Dataset=SafeChain2025.12 | 0.29 | |
| DeepSeek-R1-Distill-Qwen-7BBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=Base2025.12 | 0.26 | |
| DeepSeek-R1-Distill-Qwen-7B + SFT (SafeChain)Base Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT, Training Dataset=SafeChain2025.12 | 0.25 |