Speaker Recognition on VoxCeleb1 extended (vox1-e)
0.9EER (mean)NEMO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| NEMOParams (Million)=15.88, Need Speaker Labels?=Yes, Need Pre-trained ASR Model?=No2023.10 | 0.9 | — | 0.105 | |
| Proposed RecXiParams (Million)=7.06, Need Speaker Labels?=Yes, Need Pre-trained ASR Model?=No2023.10 | 1.075 | — | 0.114 | |
| NEMOParams (Million)=15.88, Need Speaker Labels?=Yes, Need Pre-trained ASR Model?=Yes2023.10 | 1.08 | — | 0.134 | |
| IPAParams (Million)=>60, Need Speaker Labels?=Yes, Need Pre-trained ASR Model?=Yes2023.10 | 1.68 | — | — | |
| ECAPA-TDNNinput=40-dimensional filterbanks, loss=AAM softmax2021.09 | 1.69 | 0.03 | — | |
| MCL-DPP-CParams (Million)=10.5, Need Speaker Labels?=Pseudo label, Need Pre-trained ASR Model?=No2023.10 | 1.77 | — | — | |
| w2v2-aampooling=mean&std, loss=AAM softmax, feature encoder=frozen2021.09 | 2.22 | 0.04 | — | |
| w2v2-cepooling=mean&std, feature encoder=frozen2021.09 | 2.58 | 0.1 | — | |
| MCL-DPPParams (Million)=10.5, Need Speaker Labels?=No, Need Pre-trained ASR Model?=No2023.10 | 3.17 | — | — | |
| x-vectorinput=40-dimensional filterbanks2021.09 | 5.6 | 0.05 | — | |
| w2v2-bcescoring=computes scores directly, feature encoder=frozen2021.09 | 7.19 | 0.22 | — |