Misalignment Detection on MoralChain (train)
97.2AccuracyLinear Probe
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Linear ProbeToken=z1, Evaluation Protocol=Training ([T][O] vs [O]), Backbone=GPT-2 (124M), Classifier=Logistic Regression2026.04 | 97.2 | 99.4 | |
| Linear ProbeToken=z2, Evaluation Protocol=Training ([T][O] vs [O]), Backbone=GPT-2 (124M), Classifier=Logistic Regression2026.04 | 96.8 | 99.1 | |
| Linear ProbeToken=z3, Evaluation Protocol=Training ([T][O] vs [O]), Backbone=GPT-2 (124M), Classifier=Logistic Regression2026.04 | 95.1 | 98.7 | |
| Linear ProbeToken=z4, Evaluation Protocol=Training ([T][O] vs [O]), Backbone=GPT-2 (124M), Classifier=Logistic Regression2026.04 | 93.4 | 97.8 | |
| Linear ProbeToken=z5, Evaluation Protocol=Training ([T][O] vs [O]), Backbone=GPT-2 (124M), Classifier=Logistic Regression2026.04 | 91.2 | 96.2 | |
| Linear ProbeToken=z6, Evaluation Protocol=Training ([T][O] vs [O]), Backbone=GPT-2 (124M), Classifier=Logistic Regression2026.04 | 88.7 | 94.3 |