Transfer Attack on JailBreakV-28K
78.9ASR (with SN)NeuroStrike
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| NeuroStrikeBase Model=Qwen2.5-14B-Instruct, Target (Fine-tuned) Model=oxy-1-small, Fine-tuned for=Role play2025.09 | 78.9 | 88.1 | 40 | |
| NeuroStrikeBase Model=Phi-4, Target (Fine-tuned) Model=DNA-R1, Fine-tuned for=Korean language2025.09 | 61.3 | 91.6 | 40 | |
| NeuroStrikeBase Model=Qwen2.5-32B-Instruct, Target (Fine-tuned) Model=s1.1-32B, Fine-tuned for=Reasoning2025.09 | 47.2 | 87.5 | 60 | |
| NeuroStrikeBase Model=Llama-3.1-8B-Instruct, Target (Fine-tuned) Model=Llama-3.1-8B-UltraMedical, Fine-tuned for=Biomedicine2025.09 | 38 | 83.4 | 70 | |
| NeuroStrikeBase Model=Llama-3.2-3B-Instruct, Target (Fine-tuned) Model=Llama-Doctor-3.2-3B-Instruct, Fine-tuned for=Medical consultation2025.09 | 22.4 | 76 | 40 | |
| NeuroStrikeBase Model=Qwen2.5-7B-Instruct, Target (Fine-tuned) Model=Fin-R1, Fine-tuned for=Financial reasoning2025.09 | 20.1 | 86.9 | 30 | |
| NeuroStrikeBase Model=Phi-4-mini-instruct, Target (Fine-tuned) Model=phi-4-mini-chinese-it-e1, Fine-tuned for=Reasoning & STEM2025.09 | 4.8 | 90.1 | 50 | |
| NeuroStrikeBase Model=Qwen2.5-7B-Instruct, Target (Fine-tuned) Model=Qwen2.5-Coder-7B-Instruct, Fine-tuned for=Programming2025.09 | 2.6 | 78 | 30 | |
| NeuroStrikeBase Model=Llama-3.2-1B-Instruct, Target (Fine-tuned) Model=Vikhr-Llama-3.2-1B-Instruct, Fine-tuned for=Russian language2025.09 | 0.3 | 74.4 | 50 | |
| NeuroStrikeBase Model=gemma-2-2b-it, Target (Fine-tuned) Model=gemma-2-2b-jpn-it, Fine-tuned for=Japanese language2025.09 | 0 | 63.9 | 60 | |
| NeuroStrikeBase Model=gemma-2-9b-it, Target (Fine-tuned) Model=Quill-v1, Fine-tuned for=Humanlike writing2025.09 | 0 | 43.8 | 60 |