Automated failure mode detection alignment on RIFT (test)
86.1Subjectivity ScoreLLMaJ
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| LLMaJEvaluator=LLMaJ, Model=GPT-5.22026.04 | 86.1 | 64.4 | 44.4 | 75 | 68.6 | 0 | 66.7 | 64.3 | |
| AlignmentEvaluator=Alignment2026.04 | 85.4 | 65.6 | 62.5 | 55.4 | 57.6 | 40 | 51.7 | 44.4 | |
| IRREvaluator=IRR2026.04 | 84.3 | 66.7 | 62.5 | 55.4 | 58.5 | 40 | 52.5 | 42.9 | |
| Reward varianceEvaluator=Reward variance, Conditioned Model=GPT-5.2, Generator Model=GPT-5 mini, Number of Responses=42026.04 | 84.3 | 62.9 | 71.7 | 56.2 | 56.7 | 26.7 | 51.9 | 46.7 |