Dialogue Generation on DuRecDial OOD (test)
4.81CoherenceQwen
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| QwenModel Size=32B, Evaluation Protocol=prompt-based2026.05 | 4.81 | — | 4.81 | 3.98 | 3.85 | |
| QwenModel Size=14B, Evaluation Protocol=prompt-based2026.05 | 4.8 | — | 4.78 | 3.77 | 4.15 | |
| Oursevaluation_protocol=LLM-as-a-judge2026.05 | 4.73 | 3.01 | 4.47 | 2.87 | — | |
| CSMModel Size=0.3B, Evaluation Protocol=fine-tuning2026.05 | 4.48 | — | 4.33 | 2.4 | 2.66 | |
| LLaMAModel Size=8B, Evaluation Protocol=prompt-based2026.05 | 4.45 | — | 4.42 | 3.35 | 3.09 | |
| LLaMAModel Size=3B, Evaluation Protocol=fine-tuning2026.05 | 4.4 | — | 4.53 | 2.37 | 2.19 | |
| QwenModel Size=3B, Evaluation Protocol=fine-tuning2026.05 | 4.4 | — | 4.62 | 2.37 | 2.34 | |
| LLaMAModel Size=1B, Evaluation Protocol=fine-tuning2026.05 | 4.3 | — | 4.36 | 2.26 | 2.06 | |
| TRIPDialevaluation_protocol=LLM-as-a-judge2026.05 | 4.22 | 2.4 | 4.48 | 2.48 | — | |
| T5-Zhevaluation_protocol=LLM-as-a-judge2026.05 | 4.13 | 2.49 | 3.98 | 2.09 | — | |
| TPDialevaluation_protocol=LLM-as-a-judge2026.05 | 4.09 | 2.18 | 3.74 | 2.16 | — |