LLM Safety Defense on MTSA-R3
23.5ASRMTSA-T3
Evaluation Results
| Method | Links | |
|---|---|---|
| MTSA-T3Target Model=Zephyr-7B-Beta, Iteration=32025.05 | 23.5 | |
| MTSA-T3Target Model=Llama2-7B-Chat, Iteration=32025.05 | 24 | |
| MTSA-T2Target Model=Llama2-7B-Chat, Iteration=22025.05 | 27.5 | |
| MTSA-T2Target Model=Zephyr-7B-Beta, Iteration=22025.05 | 30.5 | |
| MTSA-T1Target Model=Llama2-7B-Chat, Iteration=12025.05 | 32 | |
| MART-T3Target Model=Llama2-7B-Chat, Iteration=32025.05 | 36.5 | |
| MART-T2Target Model=Llama2-7B-Chat, Iteration=22025.05 | 37.5 | |
| HARM-T3Target Model=Llama2-7B-Chat, Iteration=32025.05 | 39 | |
| HARM-T2Target Model=Llama2-7B-Chat, Iteration=22025.05 | 41 | |
| MART-T1Target Model=Llama2-7B-Chat, Iteration=12025.05 | 41 | |
| MTSA-T1Target Model=Zephyr-7B-Beta, Iteration=12025.05 | 42.5 | |
| HARM-T1Target Model=Llama2-7B-Chat, Iteration=12025.05 | 43.5 | |
| MART-T3Target Model=Zephyr-7B-Beta, Iteration=32025.05 | 48.5 | |
| BaselineTarget Model=Llama2-7B-Chat2025.05 | 50.5 | |
| MART-T2Target Model=Zephyr-7B-Beta, Iteration=22025.05 | 51 | |
| HARM-T3Target Model=Zephyr-7B-Beta, Iteration=32025.05 | 52.5 | |
| HARM-T2Target Model=Zephyr-7B-Beta, Iteration=22025.05 | 58.5 | |
| MART-T1Target Model=Zephyr-7B-Beta, Iteration=12025.05 | 61.5 | |
| HARM-T1Target Model=Zephyr-7B-Beta, Iteration=12025.05 | 65 | |
| BaselineTarget Model=Zephyr-7B-Beta2025.05 | 74.5 |