Video-to-speech synthesis on LRS3-TED (test)
4.031UTMOSOurs
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| OursSpeaker embedding type=Video-driven, Steps=102025.03 | 4.031 | 2.789 | 39.013 | 30.45 | |
| OursSpeaker embedding type=Video-driven, Steps=10002025.03 | 3.993 | 2.759 | 38.928 | 30.37 | |
| Ground Truth2025.03 | 3.545 | 2.582 | — | 2.29 | |
| DiffV2SSpeaker embedding type=Video-driven, Steps=10002025.03 | 3.058 | 2.558 | 40.893 | 41.07 | |
| IntelligibleSpeaker embedding type=Audio-driven2025.03 | 2.702 | 2.395 | 39.377 | 29.6 | |
| LTBSSpeaker embedding type=Video-driven2025.03 | 2.417 | 2.361 | 40.006 | 84.08 | |
| SVTSSpeaker embedding type=Audio-driven2025.03 | 1.283 | 1.86 | 56.929 | 84.98 |