Dialogue Evaluation on Topical-Chat turn-level
0.444Naturalness (Pearson r)UniEval (Dial)
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| UniEval (Dial)training_status=trained2023.07 | 0.444 | 0.514 | 0.595 | 0.613 | 0.557 | 0.605 | 0.536 | 0.575 | |
| DecompEvaltraining_status=untrained2023.07 | 0.41 | 0.435 | 0.434 | 0.435 | 0.453 | 0.467 | 0.646 | 0.659 | |
| USRtraining_status=trained2023.07 | 0.337 | 0.325 | 0.416 | 0.377 | 0.456 | 0.465 | 0.222 | 0.447 | |
| CTRLEvaltraining_status=untrained2023.07 | 0.303 | 0.254 | 0.337 | 0.313 | 0.422 | 0.412 | 0.242 | 0.251 | |
| BARTScoretraining_status=untrained2023.07 | 0.287 | 0.266 | 0.251 | 0.225 | 0.411 | 0.406 | 0.226 | 0.205 | |
| BERTScoretraining_status=untrained2023.07 | 0.226 | 0.209 | 0.214 | 0.233 | 0.317 | 0.335 | 0.291 | 0.317 | |
| METEORtraining_status=untrained2023.07 | 0.212 | 0.191 | 0.25 | 0.302 | 0.367 | 0.439 | 0.333 | 0.391 | |
| BLEU-4training_status=untrained2023.07 | 0.18 | 0.175 | 0.131 | 0.235 | 0.232 | 0.316 | 0.213 | 0.31 | |
| ROUGE-Ltraining_status=untrained2023.07 | 0.176 | 0.146 | 0.193 | 0.203 | 0.295 | 0.3 | 0.31 | 0.327 | |
| MoverScoretraining_status=untrained2023.07 | 0.169 | 0.17 | 0.247 | 0.259 | 0.275 | 0.269 | 0.198 | 0.147 | |
| BLEU-1training_status=untrained2023.07 | 0.161 | 0.133 | 0.21 | 0.223 | 0.314 | 0.334 | 0.289 | 0.303 |