Speaker Extraction on YGD-3mix w/o missing subset
14.9SI-SNRi (dB)SeLG
Evaluation Results
| Method | Links | |
|---|---|---|
| SeLGModalities=Lip & Gesture, Fusion=Attention, Loss=L_SI-SNR + L_emb2026.01 | 14.9 | |
| SeLG◦Modalities=Lip & Gesture, Fusion=Concatenation, Loss=L_SI-SNR2026.01 | 14.8 | |
| SeLG†Modalities=Lip & Gesture, Fusion=Attention, Loss=L_SI-SNR2026.01 | 14.8 | |
| USEVModalities=Lip, Fusion=Concatenation, Loss=L_SI-SNR2026.01 | 13 | |
| SEGModalities=Gesture, Fusion=Concatenation, Loss=L_SI-SNR + L_emb2026.01 | 5.4 | |
| SEGModalities=Gesture, Fusion=Concatenation, Loss=L_SI-SNR2026.01 | 4.6 |