Adversarial Attack on 1,000-pair benchmark (test)
59.9Attack Success Rate (ASR)FRA-Attack
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| FRA-AttackVictim Model=Claude-Opus-4.6-thinking, Similarity Threshold=0.72026.05 | 59.9 | 61.4 | |
| M-Attack-V2Victim Model=Claude-Opus-4.6-thinking, Similarity Threshold=0.72026.05 | 48.8 | 54.7 | |
| FRA-AttackVictim Model=Gemini-3-flash-thinking, Similarity Threshold=0.72026.05 | 34.8 | 45.6 | |
| FOA-AttackVictim Model=Claude-Opus-4.6-thinking, Similarity Threshold=0.72026.05 | 32.5 | 45.3 | |
| FRA-AttackVictim Model=GPT-5.4-thinking, Similarity Threshold=0.72026.05 | 28.9 | 41.6 | |
| M-AttackVictim Model=Claude-Opus-4.6-thinking, Similarity Threshold=0.72026.05 | 28.5 | 41.4 | |
| M-Attack-V2Victim Model=Gemini-3-flash-thinking, Similarity Threshold=0.72026.05 | 28.1 | 42.6 | |
| M-Attack-V2Victim Model=GPT-5.4-thinking, Similarity Threshold=0.72026.05 | 23.1 | 37.7 | |
| FOA-AttackVictim Model=Gemini-3-flash-thinking, Similarity Threshold=0.72026.05 | 19 | 34.8 | |
| M-AttackVictim Model=Gemini-3-flash-thinking, Similarity Threshold=0.72026.05 | 14.4 | 30.6 | |
| FOA-AttackVictim Model=GPT-5.4-thinking, Similarity Threshold=0.72026.05 | 14.3 | 30.1 | |
| M-AttackVictim Model=GPT-5.4-thinking, Similarity Threshold=0.72026.05 | 11.2 | 26.4 |