Safety Alignment on WildGuardMix
55Win RateChain-of-Thought
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Chain-of-ThoughtMain Model=GPT-4o-mini, Projector=GPT-4o-mini2025.06 | 55 | 4 | 41 | |
| Best-of-NMain Model=GPT-4o-mini, Projector=GPT-4o-mini2025.06 | 52 | 9 | 39 | |
| Multi-Agent DebateMain Model=GPT-4o-mini, Projector=GPT-4o-mini2025.06 | 50 | 11 | 39 | |
| RLAIFtraining_context=after re-alignment training2025.06 | 42 | 41 | 17 | |
| Self-Refine (Debate)training_context=after re-alignment training2025.06 | 36 | 43 | 21 |