Toxicity Evaluation on RealToxicityPrompts
0Toxicity ScoreAdversarial loss
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Adversarial lossAttack learning rate=Pre-attack2024.05 | 0 | — | — | — | — | — | — | |
| Adversarial lossAttack learning rate=3 x 10^-52024.05 | 0 | — | — | — | — | — | — | |
| RepNoiseAttack learning rate=3 x 10^-52024.05 | 0 | — | — | — | — | — | — | |
| GRPO2026.06 | 0.0198 | — | — | — | — | — | — | |
| DPO2026.06 | 0.0234 | — | — | — | — | — | — | |
| PPO2026.06 | 0.0262 | — | — | — | — | — | — | |
| Base2026.06 | 0.0282 | — | — | — | — | — | — | |
| Gradient AscentAttack learning rate=Pre-attack2024.05 | 0.05 | — | — | — | — | — | — | |
| RepNoiseAttack learning rate=6 x 10^-52024.05 | 0.05 | — | — | — | — | — | — | |
| RepNoiseAttack learning rate=8 x 10^-52024.05 | 0.07 | — | — | — | — | — | — | |
| Phi-2 + BiasDPOParameters=2.7B, Alignment=BiasDPO2024.07 | 0.11 | — | — | — | — | — | — | |
| Gradient AscentAttack learning rate=3 x 10^-52024.05 | 0.12 | — | — | — | — | — | — | |
| Mistral-7BParameters=7B2024.07 | 0.14 | — | — | — | — | — | — | |
| Security VectorsAttack learning rate=3 x 10^-52024.05 | 0.16 | — | — | — | — | — | — | |
| Phi-2Parameters=2.7B2024.07 | 0.17 | — | — | — | — | — | — | |
| Security VectorsAttack learning rate=Pre-attack2024.05 | 0.17 | — | — | — | — | — | — | |
| RepNoiseAttack learning rate=Pre-attack2024.05 | 0.17 | — | — | — | — | — | — | |
| Gemma-2BParameters=2B2024.07 | 0.19 | — | — | — | — | — | — | |
| StableLM-3BParameters=3B2024.07 | 0.19 | — | — | — | — | — | — | |
| VaccineAttack learning rate=Pre-attack, p=12024.05 | 0.19 | — | — | — | — | — | — | |
| BaseAttack learning rate=Pre-attack2024.05 | 0.24 | — | — | — | — | — | — | |
| Security VectorsAttack learning rate=8 x 10^-52024.05 | 0.35 | — | — | — | — | — | — | |
| Security VectorsAttack learning rate=6 x 10^-52024.05 | 0.36 | — | — | — | — | — | — | |
| BaseAttack learning rate=3 x 10^-52024.05 | 0.4 | — | — | — | — | — | — | |
| Gradient AscentAttack learning rate=6 x 10^-52024.05 | 0.44 | — | — | — | — | — | — | |
| VaccineAttack learning rate=3 x 10^-5, p=12024.05 | 0.46 | — | — | — | — | — | — | |
| VaccineAttack learning rate=6 x 10^-5, p=12024.05 | 0.7 | — | — | — | — | — | — | |
| BaseAttack learning rate=8 x 10^-52024.05 | 0.71 | — | — | — | — | — | — | |
| VaccineAttack learning rate=8 x 10^-5, p=12024.05 | 0.72 | — | — | — | — | — | — | |
| BaseAttack learning rate=6 x 10^-52024.05 | 0.74 | — | — | — | — | — | — | |
| Gradient AscentAttack learning rate=8 x 10^-52024.05 | 0.76 | — | — | — | — | — | — | |
| Adversarial lossAttack learning rate=6 x 10^-52024.05 | 0.77 | — | — | — | — | — | — | |
| Adversarial lossAttack learning rate=8 x 10^-52024.05 | 0.78 | — | — | — | — | — | — | |
| DAPT (nontoxic)Parameter Size=126M, Training Epochs=32022.02 | — | 0.44 | 0.65 | 0.38 | 37 | 72 | 28 | |
| DAPT (nontoxic)Parameter Size=357M, Training Epochs=32022.02 | — | 0.47 | 0.69 | 0.41 | 43 | 78 | 33 | |
| DAPT (nontoxic)Parameter Size=1.3B, Training Epochs=32022.02 | — | 0.47 | 0.69 | 0.41 | 43 | 79 | 33 | |
| DAPT (nontoxic)Parameter Size=8.3B, Training Epochs=32022.02 | — | 0.48 | 0.69 | 0.42 | 45 | 79 | 35 | |
| DAPT (nontoxic)Parameter Size=530B, Training Epochs=32022.02 | — | 0.5 | 0.71 | 0.45 | 49 | 82 | 39 | |
| SGEAT (augmented)Parameter Size=126M, Training Epochs=3, Training Samples=50k2022.02 | — | 0.39 | 0.63 | 0.33 | 30 | 69 | 19 | |
| SGEAT (augmented)Parameter Size=357M, Training Epochs=3, Training Samples=50k2022.02 | — | 0.42 | 0.68 | 0.35 | 36 | 77 | 24 | |
| SGEAT (augmented)Parameter Size=1.3B, Training Epochs=3, Training Samples=50k2022.02 | — | 0.43 | 0.68 | 0.37 | 37 | 77 | 26 | |
| SGEAT (augmented)Parameter Size=8.3B, Training Epochs=3, Training Samples=50k2022.02 | — | 0.44 | 0.68 | 0.37 | 38 | 76 | 28 | |
| SGEAT (augmented)Parameter Size=530B, Training Epochs=3, Training Samples=50k2022.02 | — | 0.46 | 0.7 | 0.4 | 43 | 80 | 32 | |
| SGEAT (augmented)Parameter Size=530B, Training Epochs=3, Training Samples=100k2022.02 | — | 0.45 | 0.69 | 0.39 | 41 | 78 | 31 | |
| SGEAT (augmented)Parameter Size=530B, Training Epochs=5, Training Samples=50k2022.02 | — | 0.44 | 0.67 | 0.38 | 39 | 76 | 29 |