Safety on WildChat
42.92Refusal RateCoT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CoTBackbone=Qwen-2-7B-Instruct2025.03 | 42.92 | — | |
| BaseBackbone=Qwen-2-7B-Instruct2025.03 | 47.49 | — | |
| BaseBackbone=Llama-3.1-8B-Instruct2025.03 | 47.94 | — | |
| Self-RewardingBackbone=Llama-3.1-8B-Instruct2025.03 | 49.77 | — | |
| CoTBackbone=Llama-3.1-8B-Instruct2025.03 | 50.23 | — | |
| SFTBackbone=Llama-3.1-8B-Instruct2025.03 | 50.68 | — | |
| Self-RewardingBackbone=Qwen-2-7B-Instruct2025.03 | 52.51 | — | |
| DPOBackbone=Llama-3.1-8B-Instruct2025.03 | 54.79 | — | |
| GRPOBackbone=Llama-3.1-8B-Instruct2025.03 | 55.61 | — | |
| GRPOBackbone=Qwen-2-7B-Instruct2025.03 | 56.11 | — | |
| SACPOBackbone=Llama-3.1-8B-Instruct2025.03 | 58.45 | — | |
| SFTBackbone=Qwen-2-7B-Instruct2025.03 | 58.45 | — | |
| SACPOBackbone=Qwen-2-7B-Instruct2025.03 | 60.27 | — | |
| DPOBackbone=Qwen-2-7B-Instruct2025.03 | 66.21 | — | |
| IRLBackbone=Llama-3.1-8B-Instruct2025.03 | 67.54 | — | |
| STAIRBackbone=Llama-3.1-8B-Instruct2025.03 | 69.86 | — | |
| IRLBackbone=Qwen-2-7B-Instruct2025.03 | 72.04 | — | |
| DR-IRLBackbone=Llama-3.1-8B-Instruct2025.03 | 74.21 | — | |
| STAIRBackbone=Qwen-2-7B-Instruct2025.03 | 80.56 | — | |
| DR-IRLBackbone=Qwen-2-7B-Instruct2025.03 | 81.53 | — | |
| DPO_WhispererAlignment=DPO, Data Recipe=ear-whisperer, Base Model=SFT_DB2025.05 | — | 94.22 | |
| SFT_DBTraining=Supervised Fine-Tuning, Data Generation=AIDSAFE2025.05 | — | 85.95 |