Question Answering on WebGPT
76.42Average ScoreCFA
Evaluation Results
| Method | Links | |
|---|---|---|
| CFAModel Backbone=Qwen2.5-7B, Alignment Algorithm=DPO2026.01 | 76.42 | |
| CFAModel Backbone=Qwen2.5-7B, Alignment Algorithm=PPO2026.01 | 75.95 | |
| DPOModel Backbone=Qwen2.5-7B, Alignment Strategy=Base2026.01 | 75.91 | |
| PPOModel Backbone=Qwen2.5-7B, Alignment Strategy=Base2026.01 | 75.64 | |
| CFAModel Backbone=Llama3.1-8B, Alignment Algorithm=PPO2026.01 | 75.56 | |
| CFAModel Backbone=Llama3.1-8B, Alignment Algorithm=DPO2026.01 | 75.19 | |
| PPOModel Backbone=Llama3.1-8B, Alignment Strategy=Base2026.01 | 75.02 | |
| DPOModel Backbone=Llama3.1-8B, Alignment Strategy=Base2026.01 | 74.7 | |
| SFTModel Backbone=Qwen2.5-7B2026.01 | 73.37 | |
| SFTModel Backbone=Qwen2.5-7B2026.01 | 73.37 | |
| SFTModel Backbone=Llama3.1-8B2026.01 | 72.85 | |
| SFTModel Backbone=Llama3.1-8B2026.01 | 72.85 | |
| CFAModel Backbone=Llama2-7B, Alignment Algorithm=PPO2026.01 | 72.78 | |
| PPOModel Backbone=Llama2-7B, Alignment Strategy=Base2026.01 | 72.25 | |
| CFAModel Backbone=Llama2-7B, Alignment Algorithm=DPO2026.01 | 72.25 | |
| DPOModel Backbone=Llama2-7B, Alignment Strategy=Base2026.01 | 71.68 | |
| SFTModel Backbone=Llama2-7B2026.01 | 69.54 | |
| SFTModel Backbone=Llama2-7B2026.01 | 69.54 |