Dialogue Evaluation on Human/Model Chats (test)
83Engagement ScoreMMB Style
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MMB StyleComparison Baseline=DialoGPT std. beam2020.10 | 83 | 67 | |
| MMB StyleComparison Baseline=DialoGPT min beam 202020.10 | 71 | 60 | |
| MMB StyleComparison Baseline=Meena2020.10 | 63 | 64 | |
| MeenaBaseline vs MMB=Baseline2020.10 | 37 | 36 | |
| DialoGPTGeneration Parameters=min beam length of 202020.10 | 29 | 40 | |
| DialoGPTGeneration Parameters=standard generation parameters (GPT-2 medium, beam search with beam width 10)2020.10 | 17 | 33 |