Video-to-Speech generation on LRS3
2.29WERGround Truth
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Ground TruthTrained on dataset=true2026.04 | 2.29 | 3.29 | 3.57 | 0 | 6.66 | 6.89 | 100 | 100 | |
| HiCoDiTAudio guidance (A)=true, Video guidance (V)=true, Trained on dataset=false2026.04 | 28.98 | 3.44 | 3.8 | 8.69 | 7.1 | 6.61 | 77.08 | 67.15 | |
| HiCoDiTAudio guidance (A)=false, Video guidance (V)=true, Trained on dataset=false2026.04 | 29.41 | 3.5 | 3.84 | 9.62 | 7.15 | 6.58 | 79.41 | 56.78 | |
| FTVVenue=CVPR’25, Audio guidance (A)=false, Video guidance (V)=true, Trained on dataset=true2026.04 | 30.37 | 3.22 | 3.99 | 10.54 | 7.08 | 6.66 | 73.19 | 59.81 | |
| AlignDiTVenue=ACM MM’25, Audio guidance (A)=false, Video guidance (V)=true, Trained on dataset=true2026.04 | 31.37 | 3.24 | 3.76 | 10.02 | 6.95 | 6.82 | 76.11 | 55.97 | |
| DiffV2SVenue=ICCV’23, Audio guidance (A)=false, Video guidance (V)=true, Trained on dataset=true2026.04 | 41.07 | 2.56 | 3.06 | — | — | — | — | — | |
| EmoDubberVenue=CVPR’25, Audio guidance (A)=true, Video guidance (V)=true, Trained on dataset=false2026.04 | 41.52 | 2.95 | 2.83 | 9.25 | 6.88 | 6.85 | 72.01 | 60.52 | |
| MTLVenue=ICASSP’23, Audio guidance (A)=true, Video guidance (V)=true, Trained on dataset=true2026.04 | 76.61 | 2.42 | 1.28 | 9.84 | 5.87 | 7.51 | 61.24 | 33.47 | |
| LTBSVenue=AAAI’24, Audio guidance (A)=false, Video guidance (V)=true, Trained on dataset=false2026.04 | 84 | 2.36 | 2.42 | — | — | — | — | — | |
| Lip2WavVenue=CVPR’20, Audio guidance (A)=true, Video guidance (V)=true, Trained on dataset=false2026.04 | 98.68 | 2.47 | 1.29 | 13.43 | 3.37 | 9.85 | 63.11 | 47.85 |