Safety on AttaQ
0.81Average ScoreREINFORCE++ (Ours)
Evaluation Results
| Method | Links | |
|---|---|---|
| REINFORCE++ (Ours)Base Model=Qwen3-8B, Training Paradigm=RL, Training Dataset=STAR-1 prompt distribution, Evaluation Mode=N/A2025.12 | 0.81 | |
| Qwen3-8B + CPOBase Model=Qwen3-8B, Training Paradigm=CPO, Training Dataset=R2D-R1, Evaluation Mode=N/A2025.12 | 0.79 | |
| REINFORCE++ (Ours)Base Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=RL, Training Dataset=STAR-1 prompt distribution, Evaluation Mode=N/A2025.12 | 0.78 | |
| Qwen3-8B + SFT (STAR-1)Base Model=Qwen3-8B, Training Paradigm=SFT, Training Dataset=STAR-1, Evaluation Mode=N/A2025.12 | 0.78 | |
| DeepSeek-R1-Distill-Qwen-7B + SFT (STAR-1)Base Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT, Training Dataset=STAR-1, Evaluation Mode=N/A2025.12 | 0.76 | |
| Qwen3-8B + SFT (R2D-R1)Base Model=Qwen3-8B, Training Paradigm=SFT, Training Dataset=R2D-R1, Evaluation Mode=N/A2025.12 | 0.75 | |
| Qwen3-8B (thinking)Base Model=Qwen3-8B, Training Paradigm=Base, Training Dataset=N/A, Evaluation Mode=thinking2025.12 | 0.73 | |
| DeepSeek-R1-Distill-Qwen-7B + CPOBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=CPO, Training Dataset=R2D-R1, Evaluation Mode=N/A2025.12 | 0.59 | |
| DeepSeek-R1-Distill-Qwen-7B + SFT (R2D-R1)Base Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT, Training Dataset=R2D-R1, Evaluation Mode=N/A2025.12 | 0.56 | |
| Qwen3-8B + SFT (SafeChain)Base Model=Qwen3-8B, Training Paradigm=SFT, Training Dataset=SafeChain, Evaluation Mode=N/A2025.12 | 0.49 | |
| DeepSeek-R1-Distill-Qwen-7BBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=Base, Training Dataset=N/A, Evaluation Mode=N/A2025.12 | 0.37 | |
| DeepSeek-R1-Distill-Qwen-7B + SFT (SafeChain)Base Model=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT, Training Dataset=SafeChain, Evaluation Mode=N/A2025.12 | 0.37 |