Factual Consistency Evaluation on SummEval
46.6Spearman CorrelationALIGNSCORE-large
Evaluation Results
| Method | Links | |
|---|---|---|
| ALIGNSCORE-largeType=Ours2023.05 | 46.6 | |
| UniEvalType=Misc2023.05 | 44.3 | |
| ALIGNSCORE-baseType=Ours2023.05 | 43.4 | |
| QAFactEvalType=QA2023.05 | 42.8 | |
| CTCType=Misc2023.05 | 41.7 | |
| SummaC-CONVType=NLI2023.05 | 41.4 | |
| BARTScoreType=Misc2023.05 | 39.1 | |
| ROUGE-LType=Similarity Matching2023.05 | 38.5 | |
| SummaC-ZSType=NLI2023.05 | 38.3 | |
| ROUGE-1Type=Similarity Matching2023.05 | 38.1 | |
| ROUGE-2Type=Similarity Matching2023.05 | 37.8 | |
| DAEType=NLI2023.05 | 36.2 | |
| BLEUType=Similarity Matching2023.05 | 34.7 | |
| FactCCType=Misc2023.05 | 33.5 | |
| BERTScoreType=Similarity Matching2023.05 | 31.5 | |
| SimCSEType=Similarity Matching2023.05 | 26.4 | |
| QuestEvalType=QA2023.05 | 26.3 | |
| BLEURTType=Regression2023.05 | 23.6 | |
| NER-OverlapType=Similarity Matching2023.05 | 21.4 | |
| BLANCType=Misc2023.05 | 19 | |
| G-EVAL-4Model ID=GPT42023.07 | 0.507 | |
| ALIGN-largeModel Parameters=355M2023.07 | 0.479 | |
| ALIGNModel size=large2023.07 | 0.479 | |
| GPTScoreModel ID=GPT3.5-d032023.07 | 0.475 | |
| UniEval2023.07 | 0.443 | |
| ChatGPTModel ID=GPT3.5-turbo2023.07 | 0.433 | |
| QAFactEval2023.07 | 0.428 | |
| ALIGN-baseModel Parameters=125M2023.07 | 0.42 | |
| ALIGNModel size=base2023.07 | 0.42 | |
| CTC2023.07 | 0.417 | |
| BARTScore2023.07 | 0.391 | |
| G-EVAL-3.5Model ID=GPT3.5-d032023.07 | 0.386 | |
| BERTScore2023.07 | 0.315 | |
| BLEURT2023.07 | 0.236 | |
| FEQAType=QA2023.05 | 0.2 | |
| MNLIType=NLI2023.05 | -6.6 |