Joint text-to-audio-video generation on HDTF and Hallo3 English (test)
24.32FIDTalker-T2AV
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Talker-T2AVTarget=Facial talking-head video generation2026.04 | 24.32 | 5.5 | 3.458 | 246.39 | 6.33 | 8.505 | |
| Talker-T2AV2026.04 | 24.46 | — | — | 243.51 | 5.85 | 9.03 | |
| Sonic2026.04 | 24.51 | — | — | 284.61 | 5.34 | 8.7 | |
| LTX-2Target=General audio-video generation2026.04 | 27.46 | 25.7 | 2.769 | 272.78 | 4.671 | 9.642 | |
| Ditto2026.04 | 28.73 | — | — | 304.72 | 4.24 | 10.04 | |
| AniPortrait2026.04 | 29.65 | — | — | 453.08 | 2.59 | 11.38 | |
| FLOAT2026.04 | 32.24 | — | — | 360.68 | 3.21 | 10.28 | |
| OviTarget=General audio-video generation2026.04 | 33.84 | 29.6 | 3.03 | 284.56 | 4.166 | 9.582 | |
| MoVATarget=General audio-video generation2026.04 | 34.75 | 31.7 | 3.033 | 301.82 | 2.982 | 11.107 | |
| UniAVGenTarget=Facial talking-head video generation2026.04 | 35.27 | 30.2 | 3.459 | 298.27 | 2.555 | 11.378 | |
| UniVerse-1Target=General audio-video generation2026.04 | 36.5 | 38.5 | 1.69 | 409.58 | 1.092 | 13.906 | |
| EchoMimic2026.04 | 42.65 | — | — | 513.64 | 3.41 | 10.23 |