Speaker Verification on VoxCeleb1 (test)
0.22Cosine EERCleanCodec@31.25
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| CleanCodec@31.25Token Rate (t/s)=31.252026.06 | 0.22 | — | — | — | 99.98 | |
| CleanCodec@62.5Token Rate (t/s)=62.52026.06 | 0.23 | — | — | — | 99.99 | |
| CleanCodec@12.5Token Rate (t/s)=12.52026.06 | 0.58 | — | — | — | 99.92 | |
| MFA-TDNN (standard)Augmentation=true, Parameters (M)=7.322023.10 | 0.856 | — | — | 0.092 | — | |
| ECAPA-TDNN (MBFA-MW)Augmentation=true2023.10 | 0.87 | — | — | 0.115 | — | |
| H/ASP (AP+softmax)Augmentation=true, Parameters (M)=8.02023.10 | 0.88 | — | — | — | — | |
| Xi + tResNet (baseline)Augmentation=true, Parameters (M)=6.54, system_id=#82023.10 | 0.936 | — | — | 0.115 | — | |
| MFA-TDNN (lite)Augmentation=true, Parameters (M)=5.932023.10 | 0.968 | — | — | 0.091 | — | |
| RecXiAugmentation=true, Parameters (M)=7.06, system_id=#92023.10 | 0.984 | — | — | 0.091 | — | |
| ECAPA-TDNNAugmentation=true, Parameters (M)=6.22023.10 | 1.01 | — | — | 0.127 | — | |
| UP-LS UP-PLDA2023.10 | 1.01 | — | — | 0.124 | — | |
| SpeechNAS-5Search Space=Space (3), Embedding Size=128, Parameters (M)=4.3, GFLOPs=0.77, Latency (ms)=72, Batch size=128, Augmented training=true2021.09 | 1.02 | 0.05 | 0.17 | — | — | |
| RSKNet-MTSPAugmentation=false, Parameters (M)=13.92023.10 | 1.05 | — | — | 0.159 | — | |
| SpeechNAS-5Search Space=Space (3), Embedding Size=128, Parameters (M)=4.3, GFLOPs=0.76, Latency (ms)=71, Batch size=128, Augmented training=false2021.09 | 1.06 | 0.06 | 0.12 | — | — | |
| ResNet34 (re-implemented)Augmentation=true, Parameters (M)=6.63, system_id=#72023.10 | 1.101 | — | — | 0.128 | — | |
| SpeechNAS-4Search Space=Space (2), Embedding Size=128, Parameters (M)=3.3, GFLOPs=0.60, Latency (ms)=62, Batch size=1282021.09 | 1.11 | 0.06 | 0.24 | — | — | |
| ECAPA-TDNN (re-implemented)Augmentation=true, Parameters (M)=6.19, system_id=#62023.10 | 1.127 | — | — | 0.145 | — | |
| SpeechNAS-3Search Space=Space (1), Embedding Size=128, Parameters (M)=3.1, GFLOPs=0.44, Latency (ms)=66, Batch size=1282021.09 | 1.14 | 0.06 | 0.17 | — | — | |
| H/ASP (AAM-softmax)Augmentation=true, Parameters (M)=8.02023.10 | 1.15 | — | — | — | — | |
| RecXiAugmentation=false, Parameters (M)=7.06, system_id=#52023.10 | 1.196 | — | — | 0.122 | — | |
| H/ASP (AP+softmax)Augmentation=false, Parameters (M)=8.02023.10 | 1.21 | — | — | — | — | |
| D-TDNN-SSEmbedding Size=128, Parameters (M)=3.1, GFLOPs=0.55, Latency (ms)=70, Batch size=1282021.09 | 1.22 | 0.13 | 0.2 | — | — | |
| SpeechNAS-2Search Space=Space (1), Embedding Size=128, Parameters (M)=2.9, GFLOPs=0.49, Latency (ms)=68, Batch size=1282021.09 | 1.22 | 0.07 | 0.17 | — | — | |
| SpeechNAS-1Search Space=Space (1), Embedding Size=128, Parameters (M)=2.6, GFLOPs=0.44, Latency (ms)=66, Batch size=1282021.09 | 1.25 | 0.07 | 0.18 | — | — | |
| H/ASP (AAM-softmax)Augmentation=false, Parameters (M)=8.02023.10 | 1.25 | — | — | — | — | |
| SI-Net50Augmentation=false2023.10 | 1.28 | — | — | — | — | |
| Xi + tResNet (baseline)Augmentation=false, Parameters (M)=6.54, system_id=#42023.10 | 1.295 | — | — | 0.12 | — | |
| ECAPA-TDNN (re-implemented)Augmentation=false, Parameters (M)=6.19, system_id=#12023.10 | 1.377 | — | — | 0.137 | — | |
| ARET-25Embedding Size=512, Parameters (M)=12.2, GFLOPs=2.92021.09 | 1.39 | 0.2 | — | — | — | |
| TSP + tResNet (baseline)Augmentation=false, Parameters (M)=6.21, system_id=#32023.10 | 1.396 | — | — | 0.135 | — | |
| D-TDNN-SSEmbedding Size=512, Parameters (M)=3.5, GFLOPs=0.56, Latency (ms)=71, Batch size=1282021.09 | 1.41 | 0.19 | 0.24 | — | — | |
| ResNet34-SKDFEAugmentation=false, Parameters (M)=5.982023.10 | 1.44 | — | — | 0.168 | — | |
| Res2Net-26w8sAugmentation=true, Parameters (M)=9.32023.10 | 1.45 | — | — | 0.147 | — | |
| ResNet34 (re-implemented)Augmentation=false, Parameters (M)=6.63, system_id=#22023.10 | 1.489 | — | — | 0.155 | — | |
| BiCodecToken Rate (t/s)=502026.06 | 1.52 | — | — | — | 99.15 | |
| Dual AttentionEmbedding Size=512, Parameters (M)=21.72021.09 | 1.6 | — | — | — | — | |
| D-TDNNEmbedding Size=512, Parameters (M)=2.8, Batch size=1282021.09 | 1.81 | 0.2 | 0.28 | — | — | |
| SRE + Linear multiTrain Dataset=VoxCeleb2 + GSC1 (12), Training Protocol=multi-task, Downstream Head=Linear2021.10 | 1.98 | — | — | — | — | |
| SRE + Linear singleTrain Dataset=VoxCeleb2, Training Protocol=single-task, Downstream Head=Linear2021.10 | 2.08 | — | — | — | — | |
| Fast ResNet-34Parameters (M)=1.4, GFLOPs=0.452021.09 | 2.22 | — | — | — | — | |
| SRE + BiLSTM multiTrain Dataset=VoxCeleb2 + GSC1 (12), Training Protocol=multi-task, Downstream Head=BiLSTM2021.10 | 2.31 | — | — | — | — | |
| EF-hbt-large-960hFine-tuning strategy=Entire, Backbone architecture=HuBERT, Model scale=Large, ASR fine-tuning=960h2021.11 | 2.36 | — | — | — | — | |
| PF-hbt-large-960hFine-tuning strategy=Partial, Backbone architecture=HuBERT, Model scale=Large, ASR fine-tuning=960h2021.11 | 2.38 | — | — | — | — | |
| SRE + CNN multiTrain Dataset=VoxCeleb2 + GSC1 (12), Training Protocol=multi-task, Downstream Head=CNN2021.10 | 2.52 | — | — | — | — | |
| DNN+AAM SoftmaxTrain Dataset=VoxCeleb2, Backbone=DNN, Loss Function=AAM Softmax2021.10 | 2.69 | — | — | — | — | |
| EF-w2v-baseFine-tuning strategy=Entire, Backbone architecture=wav2vec 2.0, Model scale=Base, ASR fine-tuning=No2021.11 | 2.77 | — | — | — | — | |
| EF-hbt-baseFine-tuning strategy=Entire, Backbone architecture=HuBERT, Model scale=Base, ASR fine-tuning=No2021.11 | 2.84 | — | — | — | — | |
| EF-hbt-largeFine-tuning strategy=Entire, Backbone architecture=HuBERT, Model scale=Large, ASR fine-tuning=No2021.11 | 2.86 | — | — | — | — | |
| CNN+GhostVLADTrain Dataset=VoxCeleb2, Backbone=CNN, Downstream Head=GhostVLAD2021.10 | 2.87 | — | — | — | — | |
| PF-hbt-baseFine-tuning strategy=Partial, Backbone architecture=HuBERT, Model scale=Base, ASR fine-tuning=No2021.11 | 3.13 | — | — | — | — | |
| Siamese Capsule2021.11 | 3.14 | — | — | — | — | |
| PLDABackbone=TDNN, Back-end=PLDA2021.04 | 3.14 | 0.3456 | 0.5567 | — | — | |
| SRE + Linear multiTrain Dataset=VoxCeleb1 + GSC1 (12), Training Protocol=multi-task, Downstream Head=Linear2021.10 | 3.15 | — | — | — | — | |
| PF-w2v-baseFine-tuning strategy=Partial, Backbone architecture=wav2vec 2.0, Model scale=Base, ASR fine-tuning=No2021.11 | 3.15 | — | — | — | — | |
| PF-hbt-largeFine-tuning strategy=Partial, Backbone architecture=HuBERT, Model scale=Large, ASR fine-tuning=No2021.11 | 3.21 | — | — | — | — | |
| ResNet+AM SoftmaxTrain Dataset=VoxCeleb2, Backbone=ResNet, Loss Function=AM Softmax2021.10 | 3.23 | — | — | — | — | |
| Attention back-endBackbone=TDNN, Back-end=Proposed2021.04 | 3.26 | 0.3323 | 0.5134 | — | — | |
| SRE + CNN multiTrain Dataset=VoxCeleb1 + GSC1 (12), Training Protocol=multi-task, Downstream Head=CNN2021.10 | 3.28 | — | — | — | — | |
| SRE + Linear singleTrain Dataset=VoxCeleb1, Training Protocol=single-task, Downstream Head=Linear2021.10 | 3.35 | — | — | — | — | |
| KanadeToken Rate (t/s)=12.52026.06 | 3.38 | — | — | — | 96.82 | |
| EF-w2v-largeFine-tuning strategy=Entire, Backbone architecture=wav2vec 2.0, Model scale=Large, ASR fine-tuning=No2021.11 | 3.42 | — | — | — | — | |
| SRE + BiLSTM multiTrain Dataset=VoxCeleb1 + GSC1 (12), Training Protocol=multi-task, Downstream Head=BiLSTM2021.10 | 3.53 | — | — | — | — | |
| Wav2Vec-SVTrain Dataset=VoxCeleb1, Backbone=Wav2Vec2021.10 | 3.61 | — | — | — | — | |
| Attentive statisticsTrain Dataset=VoxCeleb1, Downstream Head=Attentive statistics2021.10 | 3.85 | — | — | — | — | |
| PF-w2v-largeFine-tuning strategy=Partial, Backbone architecture=wav2vec 2.0, Model scale=Large, ASR fine-tuning=No2021.11 | 3.85 | — | — | — | — | |
| EF-w2v-large-960hFine-tuning strategy=Entire, Backbone architecture=wav2vec 2.0, Model scale=Large, ASR fine-tuning=960h2021.11 | 4.27 | — | — | — | — | |
| PF-w2v-base-960hFine-tuning strategy=Partial, Backbone architecture=wav2vec 2.0, Model scale=Base, ASR fine-tuning=960h2021.11 | 4.38 | — | — | — | — | |
| EF-w2v-base-960hFine-tuning strategy=Entire, Backbone architecture=wav2vec 2.0, Model scale=Base, ASR fine-tuning=960h2021.11 | 4.46 | — | — | — | — | |
| PF-w2v-large-960hFine-tuning strategy=Partial, Backbone architecture=wav2vec 2.0, Model scale=Large, ASR fine-tuning=960h2021.11 | 4.47 | — | — | — | — | |
| E-TDNNEmbedding Size=512, Parameters (M)=6.1, GFLOPs=0.91, Latency (ms)=52, Batch size=1282021.09 | 4.65 | 0.43 | 0.53 | — | — | |
| F-TDNNEmbedding Size=512, Parameters (M)=12.4, GFLOPs=2.29, Latency (ms)=115, Batch size=1282021.09 | 4.66 | 0.41 | 0.57 | — | — | |
| Frozen-hbt-baseFine-tuning strategy=Frozen, Backbone architecture=HuBERT, Model scale=Base2021.11 | 5.11 | — | — | — | — | |
| TDNNEmbedding Size=512, Parameters (M)=4.2, GFLOPs=5.34, Latency (ms)=146, Batch size=242021.09 | 5.2 | 0.44 | 0.6 | — | — | |
| Frozen-w2v-largeFine-tuning strategy=Frozen, Backbone architecture=wav2vec 2.0, Model scale=Large2021.11 | 5.65 | — | — | — | — | |
| Frozen-hbt-largeFine-tuning strategy=Frozen, Backbone architecture=HuBERT, Model scale=Large2021.11 | 5.98 | — | — | — | — | |
| Frozen-w2v-baseFine-tuning strategy=Frozen, Backbone architecture=wav2vec 2.0, Model scale=Base2021.11 | 6.02 | — | — | — | — | |
| CNN + EmbeddingTrain Dataset=VoxCeleb1, Backbone=CNN, Downstream Head=Embedding2021.10 | 7.8 | — | — | — | — | |
| AutoSpeechEmbedding Size=2048, Parameters (M)=182021.09 | 8.95 | — | — | — | — | |
| CosineBackbone=TDNN, Back-end=Cosine2021.04 | 10.51 | 0.7928 | 0.8718 | — | — | |
| SRE (Random) + LinearTrain Dataset=VoxCeleb1 + GSC1 (12), Backbone State=randomly initialized, Training Protocol=multi-task, Downstream Head=Linear2021.10 | 13.2 | — | — | — | — | |
| Masked-VPCProbing=Two-layer classifier, Selection=Best layer2025.12 | 14.4 | — | — | — | — | |
| i-vectorProbing=Two-layer classifier, Selection=Best layer2025.12 | 15.7 | — | — | — | — | |
| HuBERT ObjProbing=Two-layer classifier, Selection=Best layer2025.12 | 18.3 | — | — | — | — | |
| SRE (Frozen) + LinearTrain Dataset=VoxCeleb1 + GSC1 (12), Backbone State=frozen, Training Protocol=multi-task, Downstream Head=Linear2021.10 | 20.5 | — | — | — | — | |
| log MelProbing=Two-layer classifier, Selection=Best layer2025.12 | 24.6 | — | — | — | — |