Lip-to-speech synthesis on LRS3-TED (test)
4.2096UTMOSSLD-L2S
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| SLD-L2SNFE=10, reference speaker embedding=true2026.02 | 4.2096 | 4.6075 | 0.8284 | 3,022 | 0.804 | |
| V2SFlowNFE=30, reference speaker embedding=true2026.02 | 3.6939 | 4.071 | 0.8306 | 2,755 | 0.851 | |
| NaturalL2SNFE=1, reference speaker embedding=false2026.02 | 3.6598 | 3.7695 | 0.8068 | 3,037 | 0.628 | |
| Ground Truth2026.02 | 3.5721 | 3.8105 | — | 71 | — | |
| DiffV2SNFE=1000, reference speaker embedding=false2026.02 | 3.0681 | 3.3811 | 0.7408 | 3,581 | 0.627 | |
| IntelligibleNFE=1, reference speaker embedding=true2026.02 | 2.7019 | 2.7024 | 0.8231 | 2,773 | 0.761 | |
| LipVoicerNFE=400, reference speaker embedding=false2026.02 | 2.454 | 2.6598 | 0.7132 | 2,062 | 0.588 |