Safety Evaluation on JailBreak-R1
0LRM-JailBreak ScoreSTAR-1
Evaluation Results
| Method | Links | |
|---|---|---|
| STAR-1Model Backbone=DeepSeek-R1-Distill-Llama-8B, RL Training (GRPO)=true2026.05 | 0 | |
| SInternalModel Backbone=DeepSeek-R1-Distill-Llama-8B, RL Training (GRPO)=true2026.05 | 0 | |
| BaseModel Backbone=DeepSeek-R1-Distill-Qwen-14B, RL Training (GRPO)=true2026.05 | 0 | |
| SafeChainModel Backbone=DeepSeek-R1-Distill-Qwen-14B, RL Training (GRPO)=true2026.05 | 0 | |
| SInternalModel Backbone=DeepSeek-R1-Distill-Qwen-14B, RL Training (GRPO)=true2026.05 | 0.3 | |
| STAR-1Model Backbone=DeepSeek-R1-Distill-Qwen-14B, RL Training (GRPO)=true2026.05 | 0.6 | |
| SafeChainModel Backbone=DeepSeek-R1-Distill-Llama-8B, RL Training (GRPO)=true2026.05 | 1.6 | |
| SInternalModel Backbone=DeepSeek-R1-Distill-Qwen-7B, RL Training (GRPO)=true2026.05 | 2.2 | |
| BaseModel Backbone=DeepSeek-R1-Distill-Llama-8B, RL Training (GRPO)=true2026.05 | 2.9 | |
| STAR-1Model Backbone=DeepSeek-R1-Distill-Qwen-7B, RL Training (GRPO)=true2026.05 | 3.5 | |
| BaseModel Backbone=DeepSeek-R1-Distill-Qwen-7B, RL Training (GRPO)=true2026.05 | 8.3 | |
| SafeChainModel Backbone=DeepSeek-R1-Distill-Qwen-7B, RL Training (GRPO)=true2026.05 | 8.6 |