Constitutional AI Alignment on SafeRLHF (test)
4.652Likert Score (5-Point)Reflect
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ReflectBackbone Model=GPT-4.1-mini2026.01 | 4.652 | 3.45 | 0.098 | |
| ReflectBackbone Model=Mistral-7B2026.01 | 4.628 | 2.917 | 0.035 | |
| CCBaseBackbone Model=Mistral-7B2026.01 | 4.593 | 4.017 | — | |
| CCBaseBackbone Model=GPT-4.1-mini2026.01 | 4.554 | 7.717 | — | |
| ReflectBackbone Model=Claude-3.5-Haiku2026.01 | 4.155 | 13.26 | 1.26 | |
| CCBaseBackbone Model=Claude-3.5-Haiku2026.01 | 2.895 | 47.3 | — |