Active Speaker Detection on AVA-ActiveSpeaker (test)
91.7mAPASDNet
Evaluation Results
| Method | Links | |
|---|---|---|
| ASDNetTemporal Modeling=Bidirectional-GRU2021.06 | 91.7 | |
| TalkNetAudio=true, Visual=true2021.10 | 90.8 | |
| GateFusionEvaluation Setting=External, Training Dataset=UniTalk2025.12 | 90.7 | |
| MAAS-TAN2021.01 | 88.3 | |
| MAAS-TANAudio=true, Visual=true2021.10 | 88.3 | |
| VTPAudio=false, Visual=true2021.10 | 88.2 | |
| TalkNCEEvaluation Setting=External, Training Dataset=UniTalk2025.12 | 88 | |
| Naver Corporation2021.01 | 87.8 | |
| Chung et al.Audio=true, Visual=true2021.10 | 87.8 | |
| Chung et al.2021.06 | 87.8 | |
| Active Speaker Context2021.01 | 86.7 | |
| Alcazar et al.Audio=true, Visual=true2021.10 | 86.7 | |
| ASC2021.06 | 86.7 | |
| LoCoNetEvaluation Setting=External, Training Dataset=UniTalk2025.12 | 84.4 | |
| University of Chinese Academy of Sciences2021.01 | 83.5 | |
| Zhang et al.2021.06 | 83.5 | |
| Google Baseline2021.01 | 82.1 | |
| Roth et al.Audio=true, Visual=true2021.10 | 82.1 | |
| Roth et al.2021.06 | 82.1 | |
| CNN + GAPAudio=false, Visual=true2021.10 | 80.2 | |
| TalkNetEvaluation Setting=External, Training Dataset=UniTalk2025.12 | 78.4 | |
| Roth et al.Audio=false, Visual=true2021.10 | 71.1 |