Joint text-to-audio-video generation on DH-FaceVid-1K Chinese (test)
0.148CERTalker-T2AV
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Talker-T2AVTarget=Facial talking-head video generation2026.04 | 0.148 | 2.136 | 17.63 | 103.31 | 5.47 | 8.793 | |
| UniAVGenTarget=Facial talking-head video generation2026.04 | 0.265 | 2.197 | 15.3 | 157.92 | 3.168 | 9.956 | |
| MoVATarget=General audio-video generation2026.04 | 0.359 | 1.979 | 38.87 | 249.2 | 3.008 | 10.719 | |
| LTX-2Target=General audio-video generation2026.04 | 0.461 | 2.053 | 32.49 | 318.13 | 1.656 | 12.387 | |
| UniVerse-1Target=General audio-video generation2026.04 | 0.715 | 1.511 | 19.49 | 237.41 | 0.661 | 13.678 | |
| OviTarget=General audio-video generation2026.04 | 0.873 | 2.085 | 29.75 | 224.28 | 1.496 | 11.515 |