Listening facial motion generation on Seamless Interaction (test)
17.12FDDUniLS
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| UniLS2025.12 | 17.12 | 4.75 | 0.98 | 4.304 | 0.038 | |
| UniLSArchitecture=Two-stage unified framework2025.12 | 17.12 | 4.75 | 0.98 | 4.304 | 0.038 | |
| GDPO-Listener2026.03 | 22.56 | 3.33 | 1.48 | — | — | |
| ARTalk*adaptation=adapted for speak-listen generation2025.12 | 30.62 | 9.52 | 1.53 | 10.779 | 0.072 | |
| ARTalk*Modification=Adapted with additional audio input2025.12 | 30.62 | 9.52 | 1.53 | 10.779 | 0.072 | |
| DualTalk2025.12 | 43.58 | 10.71 | 2.02 | 13.143 | 0.079 | |
| DualTalkType=Non-end-to-end speak-listen model2025.12 | 43.58 | 10.71 | 2.02 | 13.143 | 0.079 | |
| L2L2026.03 | 44.77 | 3.77 | 2.39 | — | — | |
| DualTalk2026.03 | 55.94 | 5.08 | 2.79 | — | — |