Safety Evaluation on RealToxicityPrompts (test)
96Safety ScoreSelf-Improving Pretraining
Evaluation Results
| Method | Links | |
|---|---|---|
| Self-Improving PretrainingPre-training Data=RedPajama, Pre-training Strategy=Self-Improving2026.01 | 96 | |
| Llama BasePre-training Strategy=Standard next token prediction2026.01 | 88.1 | |
| Llama Pretrain BaselinePre-training Data=RedPajama, Pre-training Strategy=Standard next token prediction2026.01 | 87.1 |