Repetition Mitigation on BadCase 3 (test)
45Repetition Rate BeforeDirect Preference Optimization (DPO) fine-tuning
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Direct Preference Optimization (DPO) fine-tuningHardware=4×A100 GPUs, Learning rate=5e-6, Batch size=4, Training epochs=3, Framework=LlamaFactory, Repetition pattern=Power-of-2 (2, 4, 8, 16 repetitions), Training Cost=4.5h (18.0 GPU-h), Test cases=282025.12 | 45 | 0 | 100 |