Prompt Hijacking on IHEval Prompt Hijacking - Alignment 1.0
82.5AccuracyLlama3.1-8B-NSHA-DPO
Evaluation Results
| Method | Links | |
|---|---|---|
| Llama3.1-8B-NSHA-DPOBackbone=Llama3.1-8B, Methodology=NSHA-DPO2026.04 | 82.5 | |
| Llama3.1-8B-NSBackbone=Llama3.1-8B, Methodology=Neuro-Symbolic2026.04 | 70.4 | |
| Llama3.1-8B-NSHA-HCALBackbone=Llama3.1-8B, Methodology=NSHA-HCAL2026.04 | 68.5 | |
| Llama3.1-8BBackbone=Llama3.1-8B, Methodology=Instruct2026.04 | 66.3 | |
| Qwen3-4B-it-NSHA-DPOBackbone=Qwen3-4B, Methodology=NSHA-DPO2026.04 | 63.7 | |
| Qwen3-4B-itBackbone=Qwen3-4B, Methodology=Instruct2026.04 | 62.6 | |
| Qwen3-4B-it-NSBackbone=Qwen3-4B, Methodology=Neuro-Symbolic2026.04 | 61.9 | |
| Llama3.1-8B-CoTBackbone=Llama3.1-8B, Methodology=Chain-of-Thought2026.04 | 59.8 | |
| Qwen3-4B-it-NSHA-HCALBackbone=Qwen3-4B, Methodology=NSHA-HCAL2026.04 | 58.7 | |
| Qwen3-4B-it-CoTBackbone=Qwen3-4B, Methodology=Chain-of-Thought2026.04 | 58.2 | |
| Qwen3-4B-it-NSHA-SFTBackbone=Qwen3-4B, Methodology=NSHA-SFT2026.04 | 50.9 | |
| Llama3.1-8B-NSHA-SFTBackbone=Llama3.1-8B, Methodology=NSHA-SFT2026.04 | 35.1 |