AdvBench
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
AdvBench (held-out split)
92.5ASR
13
Advbench-M Image + Text (test)
980HF (BE)
13
AdvBench current (full)
87.3ASR (%)
12
Advbench
84.5Attack Success Rate (ASR)
12
AdvBench
100WASR
12
AdvBench
73.3WASR
12
AdvBench gpt-4 (520 malicious intent prompts)
0ASR (%)
12
AdvBench gpt-3.5 (520 malicious intent prompts)
69.9ASR
12
AdvBench deepseek (520 malicious intent prompts)
0.4ASR
12
AdvBench (100 samples)
100Attack Success Rate
12
AdvBench-audio Harmful-Safe
86.83BRR Score
12
AdvBench
99.1ASR (GPT-4o)
12
AdvBench
100Safety Score
12
AdvBench 50 most harmful requests
95.83Attack Success Rate (ASR)
12
AdvBench
99.9F1 Score
12
AdvBench
94.4GPT-4o Jailbreak Success Rate
11
AdvBench
97.2Safety Rate
11
Advbench
100SafetyJudge Score
11
AdvBench
0ASR@1 (No Refusal)
11
AdvBench 50 out-of-distribution harmful prompts-prefill pairs 2025
80PAR
10
AdvBench Baseline No System Prompt brief-variant
0Jailbreaks Count
10
AdvBench 50
4.404PPL
10
AdvBench
99.5Safe2Harm ASR (Answer)
10
Advbench (test)
100Performance
10
AdvBench harmful behavior set
99.17Safety Score
10