Empathetic Response Generation on AvaMERG (test)
0.2851BLEU-1ES4R
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| ES4RBackbone=Qwen, Training=Fine-tuned2026.01 | 0.2851 | 0.1642 | 0.1095 | 0.0758 | 0.9058 | 0.3317 | 0.1222 | 0.2566 | 0.0225 | 0.1279 | — | |
| ES4RBackbone=Llama, Training=Fine-tuned2026.01 | 0.2773 | 0.1603 | 0.1099 | 0.0773 | 0.9055 | 0.3259 | 0.1192 | 0.2511 | 0.0244 | 0.149 | — | |
| Qwen2.5-OmniTraining=Fine-tuned2026.01 | 0.2737 | 0.1575 | 0.0952 | 0.0683 | 0.8844 | 0.3065 | 0.1129 | 0.246 | 0.0256 | 0.1394 | — | |
| BLSP-emoTraining=Fine-tuned2026.01 | 0.2708 | 0.1417 | 0.0821 | 0.0514 | 0.8688 | 0.2694 | 0.077 | 0.2153 | 0.0219 | 0.1145 | — | |
| OpenS2STraining=Fine-tuned2026.01 | 0.269 | 0.1403 | 0.0862 | 0.0556 | 0.8834 | 0.2676 | 0.0869 | 0.2161 | 0.0211 | 0.0938 | — | |
| ES4Rablation=removing speech-guided cross-modal fusion module, Training=Fine-tuned2026.01 | 0.2659 | 0.1243 | 0.0716 | 0.0448 | 0.883 | 0.2352 | 0.0606 | 0.1832 | 0.0199 | 0.0892 | — | |
| PRISMModel=PRISM (Llama), Backbone=Llama2026.06 | 0.2318 | 0.1223 | 0.0805 | 0.0555 | — | 0.2027 | 0.0649 | 0.1743 | 0.0409 | 0.2574 | 0.8801 | |
| ES4Rablation=removing the dual-level attention module, Training=Fine-tuned2026.01 | 0.2264 | 0.0552 | 0.0184 | 0.0078 | 0.8798 | 0.2167 | 0.0114 | 0.16 | 0.0169 | 0.1007 | — | |
| LLaMA-Omni 2Training=Fine-tuned2026.01 | 0.2202 | 0.0911 | 0.0504 | 0.0284 | 0.8783 | 0.2246 | 0.0456 | 0.1734 | 0.0317 | 0.1571 | — | |
| SALMONNTraining=Fine-tuned2026.01 | 0.2042 | 0.1052 | 0.0368 | 0.0254 | 0.8509 | 0.2098 | 0.0921 | 0.1426 | 0.0202 | 0.0908 | — | |
| PRISMModel=PRISM (Qwen), Backbone=Qwen2026.06 | 0.2041 | 0.1142 | 0.0792 | 0.0571 | — | 0.2254 | 0.0745 | 0.1872 | 0.039 | 0.2519 | 0.8792 | |
| OpenS2SModel=OpenS2S2026.06 | 0.1883 | 0.07 | 0.0355 | 0.0192 | — | 0.1759 | 0.0356 | 0.1408 | 0.0428 | 0.2329 | 0.8691 | |
| Qwen2.5-Omni-7BModel=Qwen2.5-Omni-7B2026.06 | 0.1737 | 0.0831 | 0.053 | 0.0352 | — | 0.188 | 0.0542 | 0.1555 | 0.0375 | 0.238 | 0.8746 | |
| Whisper+LLMTraining=Fine-tuned2026.01 | 0.1729 | 0.0616 | 0.0326 | 0.0193 | 0.8724 | 0.1822 | 0.0259 | 0.1379 | 0.0185 | 0.0735 | — | |
| PRISM (w/o Prosody-Desc)Model=w/o Prosody-Desc, Ablation=Removing prosody descriptions, Backbone=Qwen2.5-7B-Instruct2026.06 | 0.1727 | 0.0583 | 0.0271 | 0.0137 | — | 0.1521 | 0.0202 | 0.1262 | 0.028 | 0.1617 | 0.8641 | |
| ASR+LLMTraining=Fine-tuned2026.01 | 0.1701 | 0.0801 | 0.0498 | 0.0324 | 0.8681 | 0.1826 | 0.0813 | 0.1519 | 0.032 | 0.1978 | — | |
| PRISM (Always Kno)Model=Always Kno, Ablation=Enforcing knowledge usage at every turn, Backbone=Qwen2.5-7B-Instruct2026.06 | 0.1606 | 0.056 | 0.0259 | 0.0133 | — | 0.1611 | 0.0204 | 0.1301 | 0.0258 | 0.155 | 0.8667 | |
| PRISM (w/o Kno)Model=w/o Kno, Ablation=Excluding knowledge entirely, Backbone=Qwen2.5-7B-Instruct2026.06 | 0.1601 | 0.0549 | 0.0254 | 0.0129 | — | 0.1624 | 0.0205 | 0.13 | 0.025 | 0.1495 | 0.8633 | |
| LLaMA-Omni2Model=LLaMA-Omni22026.06 | 0.1565 | 0.0646 | 0.0354 | 0.0205 | — | 0.1703 | 0.0329 | 0.133 | 0.046 | 0.2376 | 0.8674 | |
| SALMONN-13BModel=SALMONN-13B2026.06 | 0.1464 | 0.057 | 0.0303 | 0.0174 | — | 0.1666 | 0.0381 | 0.1289 | 0.0218 | 0.1327 | 0.8705 | |
| ASR+LLMModel=ASR+LLM2026.06 | 0.1431 | 0.0514 | 0.025 | 0.0132 | — | 0.169 | 0.0271 | 0.1406 | 0.0286 | 0.1722 | 0.8652 | |
| SALMONN-7BModel=SALMONN-7B2026.06 | 0.1415 | 0.0616 | 0.0357 | 0.0217 | — | 0.1598 | 0.0321 | 0.1226 | 0.0225 | 0.1346 | 0.8684 | |
| OSUM-EChatModel=OSUM-EChat2026.06 | 0.1381 | 0.0485 | 0.0226 | 0.0111 | — | 0.1546 | 0.0263 | 0.1146 | 0.0342 | 0.2133 | 0.8673 | |
| SpeechGPTModel=SpeechGPT2026.06 | 0.1189 | 0.0543 | 0.0304 | 0.018 | — | 0.1437 | 0.0228 | 0.1126 | 0.0306 | 0.134 | 0.8534 |