Preference Alignment Evaluation on Indomain
0Win RateVicuna-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| Vicuna-7BBackbone Model=Vicuna-7B, Pruning Ratio=0%, Training Strategy=Teacher2025.06 | 0 | |
| daDPOBackbone Model=Vicuna-7B, Pruning Ratio=20%, Training Strategy=daDPO2025.06 | -7.3 | |
| rDPOBackbone Model=Vicuna-7B, Pruning Ratio=20%, Training Strategy=rDPO2025.06 | -9 | |
| dDPOBackbone Model=Vicuna-7B, Pruning Ratio=20%, Training Strategy=dDPO2025.06 | -31 | |
| dSFTBackbone Model=Vicuna-7B, Pruning Ratio=20%, Training Strategy=dSFT2025.06 | -40 | |
| Vicuna-7BBackbone Model=Vicuna-7B, Pruning Ratio=20%, Training Strategy=Zero-shot2025.06 | -50.6 | |
| daDPOBackbone Model=Vicuna-7B, Pruning Ratio=50%, Training Strategy=daDPO2025.06 | -68 | |
| dDPOBackbone Model=Vicuna-7B, Pruning Ratio=50%, Training Strategy=dDPO2025.06 | -73.6 | |
| rDPOBackbone Model=Vicuna-7B, Pruning Ratio=50%, Training Strategy=rDPO2025.06 | -77 | |
| dSFTBackbone Model=Vicuna-7B, Pruning Ratio=50%, Training Strategy=dSFT2025.06 | -81.6 | |
| Vicuna-7BBackbone Model=Vicuna-7B, Pruning Ratio=50%, Training Strategy=Zero-shot2025.06 | -86.6 |