Instruction Signal Recovery on WildJailbreak
0.632Judge ScorePRISM
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| PRISMBackbone=Qwen3.5-9B, Reinforcement Learning (RL)=included2026.06 | 0.632 | 63.8 | 1.1 | 0.615 | |
| PRISM w/o RLBackbone=Qwen3.5-9B, Reinforcement Learning (RL)=excluded2026.06 | 0.426 | 46.3 | 5.9 | 0.462 | |
| Activation OraclesBackbone=Qwen3.5-9B2026.06 | 0.393 | 39.5 | 0.4 | 0.449 | |
| LatentQABackbone=Qwen3.5-9B2026.06 | 0.242 | 24.4 | 0.4 | 0.134 |