Cross-modal verification on VoxCeleb1 (Seen-Heard)
0.937AUCMSM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MSMface_encoder=FaceNet, voice_encoder=Ecapa-tdnn2026.01 | 0.937 | 0.139 | |
| AML2026.01 | 0.923 | — | |
| Single Stream Net.2026.01 | 0.911 | 0.172 | |
| FOP2026.01 | 0.893 | 0.193 | |
| Learnable Pins2026.01 | 0.87 | 0.214 | |
| VisualVoiceTraining Mode=Multi-task (jointly with speech separation)2021.01 | 0.849 | 0.236 | |
| VisualVoice (single-task)Training Mode=Single-task (verification only)2021.01 | 0.75 | 0.322 | |
| Learnable Pins2021.01 | 0.738 | 0.341 | |
| RandomInitialization=Randomly initialized network2021.01 | 0.508 | 0.496 |