Visual Dubbing on Video 3-second 25fps 512x512 resolution
1Inference Time (s)Wav2Lip
Evaluation Results
| Method | Links | |
|---|---|---|
| Wav2LipModel Type=GAN, Parameters=~36M, Hardware=Single GPU2025.12 | 1 | |
| LatentSyncModel Type=Diffusion (UNet), Parameters=~816M, Denoising Steps=50, Hardware=Single GPU2025.12 | 30 | |
| X-DubModel Type=Diffusion (DiT), Parameters=~1.5B, Denoising Steps=50, Hardware=Single GPU, Resolution=512x5122025.12 | 601 | |
| MultiTalkModel Type=Diffusion (DiT), Parameters=~14B, Denoising Steps=50, Hardware=Single GPU2025.12 | 180,030 |