Factuality Evaluation on AggreFact-XSum (OLD)
73.9Balanced AccuracyMENLI
Evaluation Results
| Method | Links | |
|---|---|---|
| MENLI2024.03 | 73.9 | |
| FENICEGPT_claimsExtractor=LLM-based claims2024.03 | 69.9 | |
| FENICET5_claimsExtractor=Knowledge-distilled claim extractor2024.03 | 67.7 | |
| SummaC-Cvvariant=Convolutional2024.03 | 67.5 | |
| AlignScore2024.03 | 63.7 | |
| ChatGPT-DAPrompting=Direct Assessment2024.03 | 61.5 | |
| QAFactEval2024.03 | 60.5 | |
| ChatGPT-ZSPrompting=Zero-shot2024.03 | 60.1 | |
| QuestEval2024.03 | 59.7 | |
| ChatGPT-StarPrompting=Scale-based2024.03 | 53.8 | |
| SummaC-ZSvariant=Zero-shot2024.03 | 53.3 | |
| TrueTeacher-11BParameters=11B2024.03 | 52.8 | |
| ChatGPT-CoTPrompting=Chain-of-Thought2024.03 | 50.1 | |
| Random Baseline2024.03 | 50 |