Repetition Mitigation on BadCase 2 (test)
60Repetition Rate BeforeDirect Preference Optimization (DPO) fine-tuning
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Direct Preference Optimization (DPO) fine-tuningHardware=4×A100 GPUs, Learning rate=5e-6, Batch size=4, Training epochs=3, Framework=LlamaFactory, Repetition pattern=Power-of-2 (2, 4, 8, 16 repetitions), Training Cost=3.8h (15.2 GPU-h), Test cases=252025.12 | 60 | 2 | 96.7 |