Preference Alignment Evaluation on Pairwise
92.12Average ScoreCFA
Evaluation Results
| Method | Links | |
|---|---|---|
| CFAModel Backbone=Llama2-7B, Alignment Algorithm=DPO2026.01 | 92.12 | |
| CFAModel Backbone=Llama2-7B, Alignment Algorithm=PPO2026.01 | 91.89 | |
| PPOModel Backbone=Llama2-7B, Alignment Strategy=Base2026.01 | 91.15 | |
| CFAModel Backbone=Qwen2.5-7B, Alignment Algorithm=DPO2026.01 | 90.97 | |
| DPOModel Backbone=Llama2-7B, Alignment Strategy=Base2026.01 | 90.88 | |
| CFAModel Backbone=Qwen2.5-7B, Alignment Algorithm=PPO2026.01 | 90.65 | |
| PPOModel Backbone=Qwen2.5-7B, Alignment Strategy=Base2026.01 | 90.17 | |
| DPOModel Backbone=Qwen2.5-7B, Alignment Strategy=Base2026.01 | 89.82 | |
| SFTModel Backbone=Llama2-7B2026.01 | 89.32 | |
| SFTModel Backbone=Llama2-7B2026.01 | 89.32 | |
| SFTModel Backbone=Qwen2.5-7B2026.01 | 88.25 | |
| SFTModel Backbone=Qwen2.5-7B2026.01 | 88.25 | |
| CFAModel Backbone=Llama3.1-8B, Alignment Algorithm=DPO2026.01 | 82.9 | |
| CFAModel Backbone=Llama3.1-8B, Alignment Algorithm=PPO2026.01 | 82.25 | |
| DPOModel Backbone=Llama3.1-8B, Alignment Strategy=Base2026.01 | 81.55 | |
| PPOModel Backbone=Llama3.1-8B, Alignment Strategy=Base2026.01 | 81.38 | |
| SFTModel Backbone=Llama3.1-8B2026.01 | 79.22 | |
| SFTModel Backbone=Llama3.1-8B2026.01 | 79.22 |