Repetition Mitigation on BadCase 30 cases 1 (test)
0Repetition Rate AfterDirect Preference Optimization (DPO) fine-tuning
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Direct Preference Optimization (DPO) fine-tuningHardware=4×A100 GPUs, Learning rate=5e-6, Batch size=4, Training epochs=3, Framework=LlamaFactory, Repetition pattern=Power-of-2 (2, 4, 8, 16 repetitions), Training Cost=4.2h (16.8 GPU-h), Test cases=302025.12 | 0 | — | 100 |