Toxicity Mitigation on RealToxicityPrompts (test)
10.1Full ToxicityDGLM
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| DGLMGuidance weight=20.02024.08 | 10.1 | — | — | — | 0.5 | 38.2 | 0.869 | |
| DGLMGuidance weight=10.02024.08 | 13.5 | — | — | — | 1.3 | 33.5 | 0.867 | |
| DGLMGuidance weight=5.02024.08 | 18.2 | — | — | — | 2.5 | 30.7 | 0.865 | |
| DExperts2024.08 | 20 | — | — | — | 2.2 | 36 | 0.842 | |
| GeDi2024.08 | 24.3 | — | — | — | 5.1 | 170.5 | 0.827 | |
| DAPT2024.08 | 26.9 | — | — | — | 9.1 | 24.9 | 0.841 | |
| DGLMGuidance weight=None2024.08 | 35.5 | — | — | — | 21.8 | 28.8 | 0.862 | |
| PPLM2024.08 | 37.6 | — | — | — | 24 | 40.8 | 0.855 | |
| GPT-22024.08 | 38.3 | — | — | — | 25.4 | 34.4 | 0.853 | |
| PREADD-DBase Model=GPT-J-6B, Prompting Strategy=Dynamic, Sampling=pure sampling2023.07 | 72.4 | 24 | 74.4 | 24.1 | — | — | — | |
| PREADD-SBase Model=GPT-J-6B, Prompting Strategy=Static, Sampling=pure sampling2023.07 | 73.8 | 26.9 | 57.2 | 24.7 | — | — | — | |
| GBase Model=GPT-J-6B, Sampling=pure sampling2023.07 | 74.4 | 30.1 | 56.9 | 26.3 | — | — | — | |
| FUDGEBase Model=GPT-J-6B, Sampling=top-k sampling2023.07 | 74.4 | 29.3 | 20.3 | 28.4 | — | — | — | |
| NEGPROMPTBase Model=GPT-J-6B, Sampling=pure sampling2023.07 | 74.6 | 33.2 | 75.8 | 26.8 | — | — | — |