Dialogue Summarization on SAMSum 200 samples (test)
4.94FaithfulnessChatGPT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| ChatGPTEvaluator=ChatGPT2023.10 | 4.94 | 4.94 | 4.78 | 4.89 | |
| InstructDSEvaluator=ChatGPT2023.10 | 4.6 | 4.82 | 3.78 | 4.92 | |
| Human-writtenEvaluator=ChatGPT2023.10 | 4.49 | 4.81 | 3.74 | 4.95 | |
| Flan-UL2Evaluator=ChatGPT2023.10 | 4.45 | 4.78 | 3.52 | 4.91 | |
| BARTEvaluator=ChatGPT2023.10 | 4.22 | 4.8 | 3.37 | 4.93 | |
| AlpacaEvaluator=ChatGPT2023.10 | 3.59 | 4.07 | 3.19 | 4.89 |