Instruction Signal Recovery on DeceptionBench
68.6Judge Score (R)PRISM
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| PRISMBackbone=Qwen3.5-9B, Reinforcement Learning (RL)=included2026.06 | 68.6 | 68.8 | 0.3 | 87.1 | |
| PRISM w/o RLBackbone=Qwen3.5-9B, Reinforcement Learning (RL)=excluded2026.06 | 43.6 | 45.4 | 3.6 | 61 | |
| Activation OraclesBackbone=Qwen3.5-9B2026.06 | 36.5 | 36.7 | 0.4 | 45.3 | |
| LatentQABackbone=Qwen3.5-9B2026.06 | 19.4 | 19.7 | 0.8 | 20.5 |