Speaker Extraction on YGD-2mix (test)
13.2SI-SNRi (dB)SeLG
Evaluation Results
| Method | Links | |
|---|---|---|
| SeLGModalities=Lip & Gesture, Fusion=Attention, Loss=L_SI-SNR + L_emb2026.01 | 13.2 | |
| SeLG†Modalities=Lip & Gesture, Fusion=Attention, Loss=L_SI-SNR2026.01 | 12.9 | |
| SeLG◦Modalities=Lip & Gesture, Fusion=Concatenation, Loss=L_SI-SNR2026.01 | 12.3 | |
| USEVModalities=Lip, Fusion=Concatenation, Loss=L_SI-SNR2026.01 | 8.5 | |
| SEGModalities=Gesture, Fusion=Concatenation, Loss=L_SI-SNR + L_emb2026.01 | 7.7 | |
| SEGModalities=Gesture, Fusion=Concatenation, Loss=L_SI-SNR2026.01 | 7 |