ResearchBenchmarksGeneral LLM Evaluation on XSTestFollow23.1Refusal RateMTSA-T322.66425.60728.5531.493May 22, 2025Evaluation ResultsMethodMethodLinksRefusal RateMTSA-T3Target Model=Zephyr-7B...Target Model=Zephyr-7B-Beta, Iteration=32025.0523.1MTSA-T3Target Model=Llama2-7B...Target Model=Llama2-7B-Chat, Iteration=32025.0525.2BaselineTarget Model=Zephyr-7B...Target Model=Zephyr-7B-Beta2025.0528.3BaselineTarget Model=Llama2-7B...Target Model=Llama2-7B-Chat2025.0534