Long-form Factuality on LongFact (R@64, F1@64)
78.4R@64KLCF-zero
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| KLCF-zeroBackbone=Qwen2.5-32B, Setting=zero-shot2025.09 | 78.4 | 74.7 | 76 | 96.2 | |
| KLCF-zeroModel Backbone=Qwen2.5-14B-Base, Training Stage=Base Model2025.09 | 77.6 | 70.4 | 73.3 | 94.6 | |
| KLCF-zeroBackbone=Qwen2.5-7B, Setting=zero-shot2025.09 | 72.4 | 67.5 | 69.3 | 94.8 | |
| KLCFModel Backbone=DeepSeek-R1-Distill-Qwen-14B, Training Stage=SFT Model2025.09 | 66.8 | 78.3 | 69.2 | 79.3 | |
| GRPO&FActScore&No.ClaimsModel Backbone=DeepSeek-R1-Distill-Qwen-14B, Training Stage=SFT Model2025.09 | 65.2 | 75.7 | 68.5 | 70.3 | |
| GRPO&FActScoreModel Backbone=Qwen2.5-14B-Base, Training Stage=Base Model2025.09 | 63.4 | 69 | 66.3 | 54.7 | |
| Base (10-shot)Model Backbone=Qwen2.5-14B-Base, Training Stage=Base Model2025.09 | 61.4 | 68.5 | 63.7 | — | |
| BaseBackbone=Qwen2.5-32B, Setting=10-shot prompting2025.09 | 53.1 | 69.1 | 57.5 | — | |
| BaseBackbone=Qwen2.5-7B, Setting=10-shot prompting2025.09 | 52.2 | 60 | 54.8 | — | |
| DPO&KLCModel Backbone=DeepSeek-R1-Distill-Qwen-14B, Training Stage=SFT Model2025.09 | 43.2 | 77.9 | 53 | 56.9 | |
| DPO&FActScoreModel Backbone=DeepSeek-R1-Distill-Qwen-14B, Training Stage=SFT Model2025.09 | 40.7 | 76.5 | 51.2 | 47.2 | |
| GRPO&FActScoreModel Backbone=DeepSeek-R1-Distill-Qwen-14B, Training Stage=SFT Model2025.09 | 40.6 | 78 | 50.4 | 29.6 | |
| SFT (Distill)Model Backbone=DeepSeek-R1-Distill-Qwen-14B, Training Stage=SFT Model2025.09 | 40.3 | 76 | 50.7 | — | |
| IntuitorModel Backbone=DeepSeek-R1-Distill-Qwen-14B, Training Stage=SFT Model2025.09 | 39.7 | 77.4 | 50.2 | 41.5 | |
| CoVeModel Backbone=Qwen2.5-14B-Base, Training Stage=Base Model2025.09 | 38 | 67.6 | 45.2 | 19.8 | |
| CoVeBackbone=Qwen2.5-32B2025.09 | 37.9 | 71.8 | 46.6 | 19.5 | |
| CoVeBackbone=Qwen2.5-7B2025.09 | 32.6 | 60.5 | 38.3 | 15.5 | |
| Self-Eval-P(True)Model Backbone=Qwen2.5-14B-Base, Training Stage=Base Model2025.09 | 23.2 | 71.8 | 33.8 | 8.63 |