Toxicity Mitigation on Real Toxicity Prompts (Challenging Subset)
0.189Avg Max ToxicityM+
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| M+Model=Aya-23-8B, gen/prompt=25, Perplexity reference model=Llama-2-7b-hf2025.11 | 0.189 | 12.5 | 12.55 | 0.185 | |
| M+Model=Llama-2-7B, gen/prompt=25, Perplexity reference model=Llama-2-7b-hf2025.11 | 0.229 | 12.5 | 10.85 | 0.111 | |
| M'Model=Aya-23-8B, gen/prompt=25, Perplexity reference model=Llama-2-7b-hf2025.11 | 0.27 | 16.7 | 10.6 | 0.104 | |
| M'Model=Llama-3-8B, gen/prompt=25, Perplexity reference model=Llama-2-7b-hf2025.11 | 0.39 | 35.8 | 9.54 | 0.1 | |
| M'Model=Llama-2-7B, gen/prompt=25, Perplexity reference model=Llama-2-7b-hf2025.11 | 0.472 | 46.7 | 9.42 | 0.076 | |
| M+Model=Llama-3-8B, gen/prompt=25, Perplexity reference model=Llama-2-7b-hf2025.11 | 0.474 | 45.8 | 14.4 | 0.109 | |
| MsafepromptModel=Llama-3-8B, gen/prompt=25, Perplexity reference model=Llama-2-7b-hf2025.11 | 0.721 | 89.1 | 11.43 | 0.062 | |
| MsafepromptModel=Aya-23-8B, gen/prompt=25, Perplexity reference model=Llama-2-7b-hf2025.11 | 0.782 | 90.3 | 10.42 | 0.032 | |
| MsafepromptModel=Llama-2-7B, gen/prompt=25, Perplexity reference model=Llama-2-7b-hf2025.11 | 0.81 | 83.1 | 12.9 | 0.082 | |
| MModel=Llama-3-8B, gen/prompt=25, Perplexity reference model=Llama-2-7b-hf2025.11 | 0.857 | 98.3 | 8.04 | 0.118 | |
| MModel=Aya-23-8B, gen/prompt=25, Perplexity reference model=Llama-2-7b-hf2025.11 | 0.873 | 96.7 | 9.09 | 0.118 | |
| MModel=Llama-2-7B, gen/prompt=25, Perplexity reference model=Llama-2-7b-hf2025.11 | 0.874 | 99.2 | 8.67 | 0.09 |