Toxicity Unlearning on Toxicity
0.45S-unlearning Scoremulti-layer toxicity unlearning objective
Evaluation Results
| Method | Links | |
|---|---|---|
| multi-layer toxicity unlearning objectiveBase Model=Qwen2.5-7B2026.05 | 0.45 | |
| multi-layer toxicity unlearning objectiveBase Model=Llama3.1-8B2026.05 | 0.43 | |
| BaseBase Model=Qwen2.5-7B2026.05 | 0.43 | |
| RMUBase Model=Qwen2.5-7B2026.05 | 0.43 | |
| Adaptive RMUBase Model=Qwen2.5-7B2026.05 | 0.41 | |
| multi-layer toxicity unlearning objectiveBase Model=Olmo3-7B2026.05 | 0.35 | |
| BaseBase Model=Llama3.1-8B2026.05 | 0.34 | |
| multi-layer toxicity unlearning objectiveBase Model=Mistral-7B2026.05 | 0.34 | |
| RMUBase Model=Llama3.1-8B2026.05 | 0.33 | |
| Adaptive RMUBase Model=Llama3.1-8B2026.05 | 0.32 | |
| BaseBase Model=Mistral-7B2026.05 | 0.32 | |
| BaseBase Model=Olmo3-7B2026.05 | 0.32 | |
| RMUBase Model=Mistral-7B2026.05 | 0.31 | |
| RMUBase Model=Olmo3-7B2026.05 | 0.3 | |
| Adaptive RMUBase Model=Mistral-7B2026.05 | 0.29 | |
| Adaptive RMUBase Model=Olmo3-7B2026.05 | 0.29 |