Empathic Dialogue on Lend-an-Ear (test)
240.8Average Word CountQ + H
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| Q + HModel=QWEN-3 1.7B, Family=MINT Discourse Diversity2026.04 | 240.8 | 4.1 | 4 | 2.8 | 2.91 | 3.6 | 1.04 | 3.56 | 8.57 | 0.86 | |
| PsychoCounselModel=QWEN-3 4B, Family=Quality RL2026.04 | 205 | 4.58 | 4.85 | 4.05 | 1.73 | 1.05 | 1.01 | 4.62 | 6.58 | 0.67 | |
| PsychoCounselModel=QWEN-3 1.7B, Family=Quality RL2026.04 | 199.2 | 4.47 | 4.56 | 3.14 | 1.54 | 1.08 | 1.01 | 4.42 | 6.43 | 0.65 | |
| Q + DKL + HModel=QWEN-3 1.7B, Family=MINT Discourse Diversity2026.04 | 198.9 | 4.43 | 4.03 | 3.5 | 2.07 | 1.38 | 1.02 | 4.25 | 6.77 | 0.64 | |
| Q + HModel=QWEN-3 4B, Family=MINT Discourse Diversity2026.04 | 196.9 | 4.12 | 3.23 | 3.61 | 2.7 | 4.23 | 1.09 | 3.49 | 8.83 | 0.86 | |
| Q + DKL + HModel=QWEN-3 4B, Family=MINT Discourse Diversity2026.04 | 182.9 | 4.31 | 3.92 | 3.74 | 1.91 | 2.54 | 1.02 | 4.08 | 7.73 | 0.72 | |
| Q + DKLModel=QWEN-3 1.7B, Family=MINT Discourse Diversity2026.04 | 171.1 | 4.52 | 4.84 | 3.1 | 1.19 | 1.06 | 1.01 | 4.54 | 5.04 | 0.51 | |
| Q + DKLModel=QWEN-3 4B, Family=MINT Discourse Diversity2026.04 | 169.6 | 4.11 | 4.86 | 4.3 | 1.11 | 1.15 | 1 | 4.67 | 4.67 | 0.42 | |
| R1-Zero-DivModel=QWEN-3 1.7B, Family=Token Diversity2026.04 | 168 | 4.27 | 4.78 | 2.89 | 1.53 | 1.1 | 1.01 | 4.38 | 5.85 | 0.63 | |
| R1-Zero-DivModel=QWEN-3 4B, Family=Token Diversity2026.04 | 148.8 | 4.35 | 4.69 | 3.82 | 1.34 | 1.07 | 1 | 4.58 | 5.57 | 0.57 | |
| VS (Tactic)Model=QWEN-3 4B, Family=Prompt-based2026.04 | 88.1 | 3.46 | 1.96 | 2.89 | 1.75 | 1.41 | 1.12 | 3.67 | 4.42 | 0.54 | |
| VS (Tactic+History)Model=QWEN-3 4B, Family=Prompt-based2026.04 | 83.2 | 3.42 | 1.93 | 2.9 | 1.86 | 1.58 | 1.17 | 3.61 | 4.16 | 0.42 | |
| VanillaModel=QWEN-3 4B, Family=Prompt-based2026.04 | 75 | 3.78 | 1.64 | 3.2 | 2.01 | 1.08 | 1.05 | 3.75 | 4.65 | 0.57 | |
| Tactic PromptModel=QWEN-3 4B, Family=Prompt-based2026.04 | 74.2 | 3.78 | 2.06 | 3.47 | 1.76 | 1.22 | 1.04 | 3.88 | 4.46 | 0.52 | |
| Tactic+HistoryModel=QWEN-3 4B, Family=Prompt-based2026.04 | 73.2 | 3.77 | 1.93 | 3.19 | 1.69 | 1.48 | 1.06 | 3.78 | 4.54 | 0.4 | |
| VanillaModel=QWEN-3 1.7B, Family=Prompt-based2026.04 | 70 | 3.76 | 1.55 | 2.5 | 1.99 | 1.07 | 1.17 | 3.6 | 4.49 | 0.51 | |
| Tactic PromptModel=QWEN-3 1.7B, Family=Prompt-based2026.04 | 66.8 | 4.09 | 2.22 | 2.93 | 1.6 | 1.16 | 1.07 | 3.9 | 3.73 | 0.45 | |
| Tactic+HistoryModel=QWEN-3 1.7B, Family=Prompt-based2026.04 | 66.4 | 3.99 | 2.1 | 2.9 | 1.45 | 1.14 | 1.04 | 3.89 | 3.63 | 0.4 | |
| VS (Vanilla)Model=QWEN-3 4B, Family=Prompt-based2026.04 | 56.1 | 3.34 | 1.43 | 2.54 | 1.95 | 1.03 | 1.29 | 3.51 | 3.29 | 0.39 | |
| VS (Tactic)Model=QWEN-3 1.7B, Family=Prompt-based2026.04 | 50.8 | 3.5 | 2.14 | 2.6 | 1.6 | 1.14 | 1.22 | 3.71 | 3.41 | 0.45 | |
| VS (Tactic+History)Model=QWEN-3 1.7B, Family=Prompt-based2026.04 | 47.4 | 3.52 | 1.87 | 2.49 | 1.6 | 1.21 | 1.19 | 3.64 | 3.27 | 0.38 | |
| VS (Vanilla)Model=QWEN-3 1.7B, Family=Prompt-based2026.04 | 42.2 | 2.84 | 1.52 | 2.07 | 2.3 | 1.12 | 1.67 | 3.22 | 3.02 | 0.41 | |
| HUMAN (GOLD)2026.04 | 20.6 | 1.98 | 1.62 | 1.47 | 1.93 | 1.48 | 2.29 | 2.9 | 1.97 | 0.27 |