Safety Evaluation on StrongReject (Safety Score)
97Safety ScoreARES (Qwen)
Evaluation Results
| Method | Links | |
|---|---|---|
| ARES (Qwen)Training Configuration=Ours (Qwen)2026.04 | 97 | |
| ARES (Ministral)Training Configuration=Ours (Ministral)2026.04 | 96 | |
| General Safe-RLHFTraining Configuration=General Safe-RLHF2026.04 | 94 | |
| REFLECTOR (+GDPO)Backbone=Llama-3.1-8B-Instruct2026.05 | 89.31 | |
| STAIRBackbone=Llama-3.1-8B-Instruct2026.05 | 87.98 | |
| REFLECTOR (+GDPO)Backbone=Qwen-2.5-7B-Instruct2026.05 | 86.9 | |
| STAIRBackbone=Qwen-2.5-7B-Instruct2026.05 | 84.86 | |
| Shallow-AlignBackbone=Llama-3.1-8B-Instruct2026.05 | 82.1 | |
| Shallow-AlignBackbone=Qwen-2.5-7B-Instruct2026.05 | 79.4 | |
| Initial RLHFTraining Configuration=Initial RLHF2026.04 | 79 | |
| Original ModelTraining Configuration=Original Model2026.04 | 76 | |
| REFLECTOR (SFT)Backbone=Qwen-2.5-7B-Instruct2026.05 | 70.73 | |
| REFLECTOR (+SFT)Backbone=Llama-3.1-8B-Instruct2026.05 | 65.78 | |
| DPOBackbone=Llama-3.1-8B-Instruct2026.05 | 50.54 | |
| SFTBackbone=Llama-3.1-8B-Instruct2026.05 | 46.98 | |
| DPOBackbone=Qwen-2.5-7B-Instruct2026.05 | 45.79 | |
| OriginalBackbone=Llama-3.1-8B-Instruct2026.05 | 40.54 | |
| Self-CritiqueBackbone=Qwen-2.5-7B-Instruct2026.05 | 40.51 | |
| Self-CritiqueBackbone=Llama-3.1-8B-Instruct2026.05 | 39.85 | |
| OriginalBackbone=Qwen-2.5-7B-Instruct2026.05 | 39.05 | |
| SFTBackbone=Qwen-2.5-7B-Instruct2026.05 | 38.51 |