Speaker Extraction on YGD-2mix w/o missing subset
15.1SI-SNRi (dB)SeLG
Evaluation Results
| Method | Links | |
|---|---|---|
| SeLGModalities=Lip & Gesture, Fusion=Attention, Loss=L_SI-SNR + L_emb2026.01 | 15.1 | |
| SeLG†Modalities=Lip & Gesture, Fusion=Attention, Loss=L_SI-SNR2026.01 | 15 | |
| SeLG◦Modalities=Lip & Gesture, Fusion=Concatenation, Loss=L_SI-SNR2026.01 | 14.4 | |
| USEVModalities=Lip, Fusion=Concatenation, Loss=L_SI-SNR2026.01 | 13 | |
| SEGModalities=Gesture, Fusion=Concatenation, Loss=L_SI-SNR + L_emb2026.01 | 8.9 | |
| SEGModalities=Gesture, Fusion=Concatenation, Loss=L_SI-SNR2026.01 | 8.3 |