Dialogue Summarization on SAMSum 30 samples (test)
4.52FaithfulnessChatGPT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| ChatGPTEvaluator=Human Annotator2023.10 | 4.52 | 4.38 | 4.62 | 2.77 | |
| Human-writtenEvaluator=Human Annotator2023.10 | 4.34 | 4.54 | 3.58 | 4.36 | |
| InstructDSEvaluator=Human Annotator2023.10 | 4.13 | 4.35 | 3.54 | 4.23 | |
| Flan-UL2Evaluator=Human Annotator2023.10 | 4 | 4.38 | 3.03 | 4.29 | |
| BARTEvaluator=Human Annotator2023.10 | 3.85 | 4.36 | 3.22 | 4.3 | |
| AlpacaEvaluator=Human Annotator2023.10 | 3.24 | 3.77 | 3.45 | 3.11 |