Safety Evaluation on WildChat
97.5Safe@1UnsafeChain
Evaluation Results
| Method | Links | |
|---|---|---|
| UnsafeChainBase Model=R1-7B, Data Subset=full2025.07 | 97.5 | |
| UnsafeChainBase Model=R1-8B, Data Subset=random2025.07 | 96.5 | |
| UnsafeChainBase Model=R1-7B, Data Subset=random2025.07 | 96 | |
| UnsafeChainBase Model=R1-7B, Data Subset=selected2025.07 | 96 | |
| UnsafeChainBase Model=R1-1.5B, Data Subset=selected2025.07 | 96 | |
| SafeChainBase Model=R1-8B2025.07 | 95.5 | |
| STAR-1Base Model=R1-8B2025.07 | 95.5 | |
| R1Model Size=7B2025.07 | 95.5 | |
| STAR-1Base Model=R1-7B2025.07 | 95.5 | |
| R1Model Size=8B2025.07 | 95 | |
| UnsafeChainBase Model=R1-8B, Data Subset=selected2025.07 | 95 | |
| SafeChainBase Model=R1-7B2025.07 | 95 | |
| R1Model Size=1.5B2025.07 | 95 | |
| SafeChainBase Model=R1-1.5B2025.07 | 95 | |
| UnsafeChainBase Model=R1-1.5B, Data Subset=random2025.07 | 95 | |
| UnsafeChainBase Model=R1-8B, Data Subset=full2025.07 | 94.5 | |
| UnsafeChainBase Model=R1-1.5B, Data Subset=full2025.07 | 93.5 | |
| STAR-1Base Model=R1-1.5B2025.07 | 92 | |
| REFLECTOR (+GDPO)Backbone=Qwen-2.5-7B-Instruct2026.05 | 87.8 | |
| REFLECTOR (SFT)Backbone=Qwen-2.5-7B-Instruct2026.05 | 81.8 | |
| REFLECTOR (+GDPO)Backbone=Llama-3.1-8B-Instruct2026.05 | 81.2 | |
| STAIRBackbone=Qwen-2.5-7B-Instruct2026.05 | 77.8 | |
| REFLECTOR (+SFT)Backbone=Llama-3.1-8B-Instruct2026.05 | 72.4 | |
| Shallow-AlignBackbone=Qwen-2.5-7B-Instruct2026.05 | 71.9 | |
| STAIRBackbone=Llama-3.1-8B-Instruct2026.05 | 69.86 | |
| Shallow-AlignBackbone=Llama-3.1-8B-Instruct2026.05 | 64.2 | |
| DPOBackbone=Qwen-2.5-7B-Instruct2026.05 | 53 | |
| Self-CritiqueBackbone=Llama-3.1-8B-Instruct2026.05 | 47.5 | |
| Self-CritiqueBackbone=Qwen-2.5-7B-Instruct2026.05 | 47.2 | |
| DPOBackbone=Llama-3.1-8B-Instruct2026.05 | 44.79 | |
| SFTBackbone=Llama-3.1-8B-Instruct2026.05 | 42.68 | |
| SFTBackbone=Qwen-2.5-7B-Instruct2026.05 | 40.4 | |
| OriginalBackbone=Qwen-2.5-7B-Instruct2026.05 | 39.6 | |
| OriginalBackbone=Llama-3.1-8B-Instruct2026.05 | 38.5 |