Toxic Language Suppression on RealToxicityPrompts 10K nontoxic prompts GPT2-large generation (test)
0.172Max ToxicityLLMBRACES
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| LLMBRACESEvaluation Protocol=Zero-Shot, Rank (r)=162025.03 | 0.172 | 0.027 | 31.91 | 51 | 83 | 86 | |
| LLMBRACESEvaluation Protocol=Supervised FT, Rank (r)=82025.03 | 0.215 | 0.061 | 19.44 | 54 | 85 | 86 | |
| LMSteerEvaluation Protocol=Supervised FT2025.03 | 0.249 | 0.089 | 28.26 | 55 | 84 | 84 | |
| DExpertsEvaluation Protocol=Supervised FT2025.03 | 0.314 | 0.128 | 32.41 | 58 | 84 | 84 | |
| PromptT5Evaluation Protocol=Zero-Shot2025.03 | 0.32 | 0.172 | 55.1 | 58 | 76 | 70 | |
| GeDiEvaluation Protocol=Supervised FT2025.03 | 0.363 | 0.217 | 60.03 | 62 | 84 | 83 | |
| LoRAEvaluation Protocol=Supervised FT2025.03 | 0.365 | 0.21 | 21.11 | 53 | 85 | 86 |