Long-form Factuality on LongWiki
81.2Recall@32KLCF-zero
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| KLCF-zeroBackbone=Qwen2.5-32B, Setting=zero-shot2025.09 | 81.2 | 53.2 | 63.1 | |
| KLCF-zeroModel Backbone=Qwen2.5-14B-Base, Training Stage=Base Model2025.09 | 68.1 | 55.2 | 56.8 | |
| BaseBackbone=Qwen2.5-32B, Setting=10-shot prompting2025.09 | 66.4 | 45.3 | 52 | |
| KLCFModel Backbone=DeepSeek-R1-Distill-Qwen-14B, Training Stage=SFT Model2025.09 | 66.3 | 59.7 | 65.1 | |
| Base (10-shot)Model Backbone=Qwen2.5-14B-Base, Training Stage=Base Model2025.09 | 66.1 | 43.5 | 51.1 | |
| KLCF-zeroBackbone=Qwen2.5-7B, Setting=zero-shot2025.09 | 63.3 | 48.7 | 51.4 | |
| GRPO&FActScore&No.ClaimsModel Backbone=DeepSeek-R1-Distill-Qwen-14B, Training Stage=SFT Model2025.09 | 61.6 | 56.8 | 61 | |
| GRPO&FActScoreModel Backbone=Qwen2.5-14B-Base, Training Stage=Base Model2025.09 | 53.2 | 47.3 | 53.8 | |
| BaseBackbone=Qwen2.5-7B, Setting=10-shot prompting2025.09 | 52.9 | 35.9 | 41.2 | |
| IntuitorModel Backbone=DeepSeek-R1-Distill-Qwen-14B, Training Stage=SFT Model2025.09 | 50.5 | 58 | 51.2 | |
| DPO&KLCModel Backbone=DeepSeek-R1-Distill-Qwen-14B, Training Stage=SFT Model2025.09 | 50.5 | 58.4 | 51.7 | |
| SFT (Distill)Model Backbone=DeepSeek-R1-Distill-Qwen-14B, Training Stage=SFT Model2025.09 | 50.3 | 53.2 | 49.4 | |
| DPO&FActScoreModel Backbone=DeepSeek-R1-Distill-Qwen-14B, Training Stage=SFT Model2025.09 | 50.2 | 53.8 | 49.6 | |
| Self-Eval-P(True)Model Backbone=Qwen2.5-14B-Base, Training Stage=Base Model2025.09 | 49.8 | 56.7 | 50.4 | |
| GRPO&FActScoreModel Backbone=DeepSeek-R1-Distill-Qwen-14B, Training Stage=SFT Model2025.09 | 47.2 | 64.7 | 51 | |
| CoVeModel Backbone=Qwen2.5-14B-Base, Training Stage=Base Model2025.09 | 43.5 | 38.1 | 36.8 | |
| CoVeBackbone=Qwen2.5-32B2025.09 | 37.5 | 41 | 35.5 | |
| CoVeBackbone=Qwen2.5-7B2025.09 | 29.3 | 35.7 | 29.4 |