Misalignment Detection on MoralChain (test)
89.4AccuracyLinear Probe
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Linear ProbeToken=z1, Evaluation Protocol=Transfer ([T] vs baseline), Backbone=GPT-2 (124M), Classifier=Logistic Regression2026.04 | 89.4 | 0.951 | |
| Linear ProbeToken=z2, Evaluation Protocol=Transfer ([T] vs baseline), Backbone=GPT-2 (124M), Classifier=Logistic Regression2026.04 | 84.7 | 0.922 | |
| Linear ProbeToken=z3, Evaluation Protocol=Transfer ([T] vs baseline), Backbone=GPT-2 (124M), Classifier=Logistic Regression2026.04 | 78.3 | 0.874 | |
| Linear ProbeToken=z4, Evaluation Protocol=Transfer ([T] vs baseline), Backbone=GPT-2 (124M), Classifier=Logistic Regression2026.04 | 71.2 | 0.803 | |
| Linear ProbeToken=z5, Evaluation Protocol=Transfer ([T] vs baseline), Backbone=GPT-2 (124M), Classifier=Logistic Regression2026.04 | 64.8 | 0.724 | |
| Linear ProbeToken=z6, Evaluation Protocol=Transfer ([T] vs baseline), Backbone=GPT-2 (124M), Classifier=Logistic Regression2026.04 | 58.3 | 0.651 |