Safety Evaluation on Search attack evaluation set (held-out)
79.2Refusal RateLlama-3.2-3B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Llama-3.2-3BMitigation Status=No mitig., Model Scale=3B, RL Training Algorithm=GRPO2025.10 | 79.2 | 78.1 | 22.5 | |
| Qwen-2.5-7BMitigation Status=No mitig., Model Scale=7B, RL Training Algorithm=GRPO2025.10 | 75.3 | 74.8 | 37 | |
| Llama-3.2-3B (Mitig. V1)Mitigation Status=Mitig. V1 (Representation-guided RL), Model Scale=3B, RL Training Algorithm=GRPO, Training Data=benign data only2025.10 | 74.8 | 82.3 | 24.8 | |
| Qwen-2.5-7B (Mitig. V1)Mitigation Status=Mitig. V1 (Representation-guided RL), Model Scale=7B, RL Training Algorithm=GRPO, Training Data=benign data only2025.10 | 74 | 74.3 | 39.7 |