Speaking facial motion generation on Seamless Interaction (test)
2.86LVEDualTalk
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| DualTalk2026.03 | 2.86 | 1.34 | 64.84 | 5.04 | 3.7 | |
| GDPO-Listener2026.03 | 3.08 | 1.25 | 30.87 | 4.44 | 1.67 | |
| L2L2026.03 | 3.4 | 1.52 | 55.1 | 5.15 | 3.38 | |
| UniLS2025.12 | 5.83 | 1.89 | 18.41 | 4.67 | 0.71 | |
| UniLSArchitecture=Two-stage unified framework2025.12 | 5.83 | 1.89 | 18.41 | 4.67 | 0.71 | |
| DualTalk2025.12 | 6.35 | 1.95 | 37.46 | 9.7 | 1.02 | |
| DualTalkType=Non-end-to-end speak-listen model2025.12 | 6.35 | 1.95 | 37.46 | 9.7 | 1.02 | |
| ARTalk*adaptation=adapted for speak-listen generation2025.12 | 6.79 | 2.02 | 27.41 | 8.55 | 0.81 | |
| ARTalk*Modification=Adapted with additional audio input2025.12 | 6.79 | 2.02 | 27.41 | 8.55 | 0.81 | |
| ARTalk2025.12 | 7.46 | 2.12 | 31.64 | 7.66 | 1.19 | |
| ARTalkType=Autoregressive2025.12 | 7.46 | 2.12 | 31.64 | 7.66 | 1.19 | |
| DiffPoseTalk2025.12 | 9.48 | 2.96 | 32.66 | 7.89 | 1.4 | |
| DiffPoseTalkType=Diffusion-based transformer2025.12 | 9.48 | 2.96 | 32.66 | 7.89 | 1.4 |