Preference Optimization on Alpaca-GPT4 Style
85.3Win RateF-beta
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| F-betabeta (β)=10^0, Backbone=Qwen2.5-3B-Instruct2025.06 | 85.3 | 36.35 | |
| DPOBackbone=Qwen2.5-3B-Instruct2025.06 | 84.78 | 37.86 | |
| F-betabeta (β)=10^-4, Backbone=Qwen2.5-3B-Instruct2025.06 | 84.32 | 41.97 | |
| F-betabeta (β)=10^-2, Backbone=Qwen2.5-3B-Instruct2025.06 | 84.25 | 36.37 | |
| F-betabeta (β)=0, Backbone=Qwen2.5-3B-Instruct2025.06 | 83.98 | 50.12 |