Reward Accuracy on Cleaned-PKU-HH-SafeRLHF (test)
91.8Reward AccuracyCurri-DPO
Evaluation Results
| Method | Links | |
|---|---|---|
| Curri-DPOBackbone=LLaMA-3-8B2026.05 | 91.8 | |
| Staged-CompetenceBackbone=LLaMA-3-8B2026.05 | 91.3 | |
| Curri-DPOBackbone=Qwen3-8B2026.05 | 90.4 | |
| Standard DPOBackbone=LLaMA-3-8B2026.05 | 89.8 | |
| Staged-CompetenceBackbone=Qwen3-8B2026.05 | 89.6 | |
| SequentialBackbone=LLaMA-3-8B2026.05 | 89.3 | |
| Sqrt-CompetenceBackbone=LLaMA-3-8B2026.05 | 89 | |
| Staged-CompetenceBackbone=Yi-1.5-9B2026.05 | 88.2 | |
| SequentialBackbone=Qwen3-8B2026.05 | 87 | |
| Standard DPOBackbone=Qwen3-8B2026.05 | 86.7 | |
| Sqrt-CompetenceBackbone=Qwen3-8B2026.05 | 86.7 | |
| Curri-DPOBackbone=Yi-1.5-9B2026.05 | 86.5 | |
| SequentialBackbone=Yi-1.5-9B2026.05 | 85.7 | |
| Standard DPOBackbone=Yi-1.5-9B2026.05 | 85.5 | |
| Sqrt-CompetenceBackbone=Yi-1.5-9B2026.05 | 84.9 |