Cross-modal verification on MAV-Celeb (test)
17.7EER (All)Audio-visual
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Audio-visual2026.01 | 17.7 | 17.1 | 18.4 | |
| Ours2026.01 | 17.7 | 16.5 | 18.9 | |
| HLT2026.01 | 18.2 | 21.8 | 14.7 | |
| Proposed Combined Training StrategyStrategy=Combination of pre-trained models for heard scenarios and fine-tuned models for unheard scenarios2025.12 | 23.99 | — | — | |
| Xaiofei2026.01 | 24.7 | 28.5 | 20.9 | |
| FOP2026.01 | 27.5 | 29.3 | 25.8 | |
| MavCeleb Fine-tuned ModelTraining Configuration=German train2025.12 | 30.1 | — | — | |
| MavCeleb Fine-tuned ModelTraining Configuration=English train, Note=Predicted by model trained on all VoxCeleb2 data for heard scenarios2025.12 | 30.6 | — | — |