Factuality Evaluation on AggreFact-CNN (OLD)
82.1Balanced AccuracyFENICEGPT_claims
Evaluation Results
| Method | Links | |
|---|---|---|
| FENICEGPT_claimsExtractor=LLM-based claims2024.03 | 82.1 | |
| TrueTeacher-11BParameters=11B2024.03 | 81.9 | |
| FENICET5_claimsExtractor=Knowledge-distilled claim extractor2024.03 | 80.6 | |
| QAFactEval2024.03 | 80.3 | |
| SummaC-Cvvariant=Convolutional2024.03 | 78.9 | |
| AlignScore2024.03 | 78 | |
| SummaC-ZSvariant=Zero-shot2024.03 | 76.3 | |
| ChatGPT-ZSPrompting=Zero-shot2024.03 | 74.3 | |
| ChatGPT-StarPrompting=Scale-based2024.03 | 71.2 | |
| ChatGPT-DAPrompting=Direct Assessment2024.03 | 71 | |
| DAENote=Trained on XSumFaith2024.03 | 69.7 | |
| MENLI2024.03 | 68.4 | |
| ChatGPT-CoTPrompting=Chain-of-Thought2024.03 | 66.7 | |
| QuestEval2024.03 | 65.2 | |
| Random Baseline2024.03 | 50 |