Cross-modal verification on VoxCeleb1 (Unseen-Unheard)
85AUCWang et al.
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Wang et al.2026.01 | 85 | — | |
| MSMface_encoder=FaceNet, voice_encoder=Ecapa-tdnn2026.01 | 85 | 22.9 | |
| DRL2026.01 | 84.6 | 25 | |
| FOP2026.01 | 83.5 | 24.9 | |
| VF Aligner2026.01 | 83 | 24.4 | |
| SBNet.2026.01 | 82.4 | 25.7 | |
| AML2026.01 | 80.6 | — | |
| Single Stream Net.2026.01 | 78.8 | 29.5 | |
| Learnable Pins2026.01 | 78.5 | 29.6 | |
| VisualVoiceTraining Mode=Multi-task (jointly with speech separation)2021.01 | 74.2 | 32.3 | |
| VisualVoice (single-task)Training Mode=Single-task (verification only)2021.01 | 72.4 | 34.7 | |
| Learnable Pins2021.01 | 63.5 | 39.2 | |
| RandomInitialization=Randomly initialized network2021.01 | 49.7 | 50.1 | |
| DIMNet2026.01 | — | 24.9 |