Speaker Verification on VoxCeleb1 (Vox1-O)
0.14EERW2V-BERT 2.0
Evaluation Results
| Method | Links | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| W2V-BERT 2.0Params=587M, GMACs=57.90, Large-Margin Finetuning=-, Training Data=VoxBlink2 + VoxCeleb22026.03 | 0.14 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SimAM-ResNet100Params=50.2M, GMACs=57.24, Large-Margin Finetuning=-, Training Data=VoxBlink2 + VoxCeleb22026.03 | 0.23 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReDimNet2-B6Params=12.3M, GMACs=13.05, Large-Margin Finetuning=Yes, Training Data=VoxCeleb2-dev2026.03 | 0.29 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReDimNet2-B5Params=8.9M, GMACs=9.62, Large-Margin Finetuning=Yes, Training Data=VoxCeleb2-dev2026.03 | 0.33 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReDimNet2-B4Params=6.6M, GMACs=4.62, Large-Margin Finetuning=Yes, Training Data=VoxCeleb2-dev2026.03 | 0.37 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| W2V-BERT 2.0Params=587M, GMACs=57.90, Large-Margin Finetuning=Yes, Training Data=VoxCeleb2-dev2026.03 | 0.38 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CurryLoss=Curry2026.03 | 0.38 | 0.04 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReDimNet-B6Params=15.0M, GMACs=20.27, Large-Margin Finetuning=Yes, Training Data=VoxCeleb2-dev2026.03 | 0.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReDimNet2-B3Params=4.1M, GMACs=2.70, Large-Margin Finetuning=Yes, Training Data=VoxCeleb2-dev2026.03 | 0.42 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SimAM-ResNet34Params=25.2M, GMACs=18.20, Large-Margin Finetuning=-, Training Data=VoxBlink2 + VoxCeleb22026.03 | 0.42 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReDimNet-B5Params=9.2M, GMACs=9.87, Large-Margin Finetuning=Yes, Training Data=VoxCeleb2-dev2026.03 | 0.43 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ECAPA2Params=27.1M, GMACs=187.0*, Large-Margin Finetuning=Yes, Training Data=VoxCeleb2-dev2026.03 | 0.44 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReDimNet-B3Params=3.0M, GMACs=3.00, Large-Margin Finetuning=Yes, Training Data=VoxCeleb2-dev2026.03 | 0.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReDimNet-B4Params=6.3M, GMACs=4.80, Large-Margin Finetuning=Yes, Training Data=VoxCeleb2-dev2026.03 | 0.51 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| WavLMParams=324M, GMACs=26.53, Large-Margin Finetuning=Yes, Training Data=VoxCeleb2-dev2026.03 | 0.52 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ResNet293Params=28.6M, GMACs=28.10, Large-Margin Finetuning=Yes, Training Data=VoxCeleb2-dev2026.03 | 0.53 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReDimNet-B2Params=4.7M, GMACs=0.90, Large-Margin Finetuning=Yes, Training Data=VoxCeleb2-dev2026.03 | 0.57 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReDimNet2-B2Params=3.6M, GMACs=0.95, Large-Margin Finetuning=Yes, Training Data=VoxCeleb2-dev2026.03 | 0.57 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TRKDTeacher Model=ReDim-B5, Student Model=ReDim-B2, Transfer Type=Homogeneous2026.01 | 0.627 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CAM++Params=7.2M, GMACs=1.15, Large-Margin Finetuning=Yes, Training Data=VoxCeleb2-dev2026.03 | 0.71 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SKA-TDNNInput features=mel-spectrogram, Input duration=3 seconds2024.01 | 0.72 | 0.0457 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RawNet3Input features=raw waveform2024.01 | 0.73 | 0.0581 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ECAPA512 + U^3-xi# Param.=6.69 M, Loss=USphereFace2 (1)+(4), Uncertainty-aware cosine score=true2026.07 | 0.739 | 0.102 | — | — | — | — | — | — | — | — | — | — | — | — | 12.81 | |
| SpeakerCard-1MRegime=audio only2026.06 | 0.76 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini-DFResNet114Params=6.5M, GMACs=5.42, Large-Margin Finetuning=No, Training Data=VoxCeleb2-dev2026.03 | 0.77 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReDimNet2-B1Params=2.1M, GMACs=0.56, Large-Margin Finetuning=Yes, Training Data=VoxCeleb2-dev2026.03 | 0.78 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NeXt-TDNN (C=256)Params=7.1M, GMACs=1.35*, Large-Margin Finetuning=No, Training Data=VoxCeleb2-dev2026.03 | 0.79 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NeXt-TDNN (C=256, B=3)Params=7.1M, MACs=2.027G, RTF (x10^-3)=1.31, Model Scale=base2023.12 | 0.79 | 0.0865 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ECAPA-TDNN2026.06 | 0.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ECAPA512 + U^3-xi# Param.=6.69 M, Loss=UAM-Softmax (1)+(4), Uncertainty-aware cosine score=true2026.07 | 0.808 | 0.084 | — | — | — | — | — | — | — | — | — | — | — | — | 19.46 | |
| CAM++# Param.=7.2 M, Uncertainty-aware cosine score=false2026.07 | 0.808 | 0.109 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NeXt-TDNN-l (C=256)Params=6.0M, GMACs=1.13*, Large-Margin Finetuning=No, Training Data=VoxCeleb2-dev2026.03 | 0.81 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NeXt-TDNN-l(C=256, B=3)Params=6.0M, MACs=1.695G, RTF (x10^-3)=0.88, Model Scale=base2023.12 | 0.81 | 0.0909 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ECAPA512 + U^3-xi# Param.=6.69 M, Loss=UAAM-Softmax (1)+(2), Uncertainty-aware cosine score=true2026.07 | 0.819 | 0.1 | — | — | — | — | — | — | — | — | — | — | — | — | 18.53 | |
| VoxDisentangler2026.03 | 0.82 | 0.12 | — | — | — | — | 0.17 | — | — | — | — | — | — | — | — | |
| WavLM-Base SV2026.06 | 0.84 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ECAPA512 + U^3-xi# Param.=6.69 M, Loss=UAAM-Softmax (1)+(4), Uncertainty-aware cosine score=true2026.07 | 0.84 | 0.086 | — | — | — | — | — | — | — | — | — | — | — | — | 21.22 | |
| AM-SoftmaxObjective=AM-Softmax, Backbone=ECAPA-TDNN2026.01 | 0.8453 | 0.1068 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ChebyAAMObjective=ChebyAAM, Backbone=ECAPA-TDNN2026.01 | 0.8453 | 0.0837 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ECAPA-TDNNInput features=mel-spectrogram, Input duration=3 seconds2024.01 | 0.85 | 0.0666 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReDimNet-B1Params=2.2M, GMACs=0.54, Large-Margin Finetuning=Yes, Training Data=VoxCeleb2-dev2026.03 | 0.85 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ECAPA512 + U^3-xi# Param.=6.69 M, Loss=UAAM-Softmax (1) [22], Uncertainty-aware cosine score=true2026.07 | 0.851 | 0.113 | — | — | — | — | — | — | — | — | — | — | — | — | 14.95 | |
| ECAPA512 + U^3-xi# Param.=6.69 M, Loss=USphereFace2 (1)+(4), Uncertainty-aware cosine score=false2026.07 | 0.856 | 0.104 | — | — | — | — | — | — | — | — | — | — | — | — | 5.21 | |
| ECAPA1024# Param.=14.65 M, Uncertainty-aware cosine score=false2026.07 | 0.856 | 0.09 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MFA-ConformerInput features=mel-spectrogram, Input duration=3 seconds2024.01 | 0.86 | 0.0627 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Teachersource=Wespeaker2026.07 | 0.86 | 0.09 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ResNet34# Param.=6.63 M, Uncertainty-aware cosine score=false2026.07 | 0.867 | 0.091 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TRKDTeacher Model=RN152, Student Model=MNV2, Transfer Type=Heterogeneous2026.01 | 0.883 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ECAPA512 + U^3-xi# Param.=6.69 M, Loss=UAM-Softmax (1)+(4), Uncertainty-aware cosine score=false2026.07 | 0.888 | 0.099 | — | — | — | — | — | — | — | — | — | — | — | — | 11.46 | |
| ECAPA-TDNNScoring=Cosine scoring2026.03 | 0.89 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ECAPA512 + U^3-xi# Param.=6.69 M, Loss=UAAM-Softmax (1) [22], Uncertainty-aware cosine score=false2026.07 | 0.894 | 0.122 | — | — | — | — | — | — | — | — | — | — | — | — | 10.6 | |
| AAM-SoftmaxObjective=AAM-Softmax, Backbone=ECAPA-TDNN2026.01 | 0.8988 | 0.101 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Teacher (w/o KD)Teacher Model=ECAPA1024, Student Model=ECAPA400, Transfer Type=Homogeneous2026.01 | 0.904 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Fair-Gate2026.03 | 0.92 | 0.11 | — | — | — | — | 0.26 | — | — | — | — | — | — | — | — | |
| ECAPA512 + U^3-xi# Param.=6.69 M, Loss=UAAM-Softmax (3), Uncertainty-aware cosine score=true2026.07 | 0.92 | 0.117 | — | — | — | — | — | — | — | — | — | — | — | — | 9.05 | |
| NeXt-TDNN (C=384, B=1)Params=6.7M, MACs=1.862G, RTF (x10^-3)=0.71, Model Scale=base2023.12 | 0.93 | 0.0833 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ECAPA512 + U^3-xi# Param.=6.69 M, Loss=UAAM-Softmax (3), Uncertainty-aware cosine score=false2026.07 | 0.93 | 0.117 | — | — | — | — | — | — | — | — | — | — | — | — | 8.32 | |
| ECAPA512 + U^3-xi# Param.=6.69 M, Loss=UAAM-Softmax (1)+(4), Uncertainty-aware cosine score=false2026.07 | 0.936 | 0.102 | — | — | — | — | — | — | — | — | — | — | — | — | 13.4 | |
| ECAPA (C=512)Params=6.2M, GMACs=1.04, Large-Margin Finetuning=No, Training Data=VoxCeleb2-dev2026.03 | 0.94 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ECAPA512 + U^3-xi# Param.=6.69 M, Loss=UAAM-Softmax (1)+(2), Uncertainty-aware cosine score=false2026.07 | 0.957 | 0.122 | — | — | — | — | — | — | — | — | — | — | — | — | 9.26 | |
| EfficientTDNN-BaseParams=5.8M, MACs=1.450G, RTF (x10^-3)=1.32, Model Scale=base2023.12 | 0.96 | 0.0924 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ECAPA512# Param.=6.19 M, Loss=SphereFace2 [37], [38], Uncertainty-aware cosine score=false2026.07 | 0.963 | 0.108 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TRKDTeacher Model=SAM-RN50, Student Model=R2N34, Transfer Type=Heterogeneous2026.01 | 0.968 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TRKDTeacher Model=ECAPA1024, Student Model=ECAPA400, Transfer Type=Homogeneous2026.01 | 0.978 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ECAPA-TDNN + GRL2026.03 | 0.98 | 0.13 | — | — | — | — | 0.22 | — | — | — | — | — | — | — | — | |
| ECAPA512# Param.=6.19 M, Loss=AM-Softmax [35], [36], Uncertainty-aware cosine score=false2026.07 | 1.005 | 0.107 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NeXt-TDNN (C=128)Params=1.9M, GMACs=0.35*, Large-Margin Finetuning=No, Training Data=VoxCeleb2-dev2026.03 | 1.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NeXt-TDNN (C=128, B=3)Params=1.9M, MACs=0.519G, RTF (x10^-3)=1.29, Model Scale=mobile2023.12 | 1.03 | 0.0954 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReDimNet2-B0Params=1.1M, GMACs=0.33, Large-Margin Finetuning=Yes, Training Data=VoxCeleb2-dev2026.03 | 1.04 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NeXt-TDNN-l(C=384, B=1)Params=5.9M, MACs=1.609G, RTF (x10^-3)=0.63, Model Scale=base2023.12 | 1.05 | 0.0957 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CFKDBitrate=24 kbps, Backbone=ECAPA-TDNN1024, lambda=402026.07 | 1.05 | 0.118 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GKDTeacher Model=ECAPA1024, Student Model=ECAPA400, Transfer Type=Homogeneous2026.01 | 1.058 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ECAPA512# Param.=6.19 M, Loss=AAM-Softmax [30], Uncertainty-aware cosine score=false2026.07 | 1.069 | 0.122 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpeakerCard-1MRegime=balanced2026.06 | 1.07 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini SD-ResNet38# Param.=6.72 M, Uncertainty-aware cosine score=false2026.07 | 1.085 | 0.099 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NeXt-TDNN-l (C=128)Params=1.6M, GMACs=0.29*, Large-Margin Finetuning=No, Training Data=VoxCeleb2-dev2026.03 | 1.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NeXt-TDNN-l(C=128, B=3)Params=1.6M, MACs=0.441G, RTF (x10^-3)=0.89, Model Scale=mobile2023.12 | 1.1 | 0.1079 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DKDTeacher Model=ECAPA1024, Student Model=ECAPA400, Transfer Type=Homogeneous2026.01 | 1.101 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ECAPA-TDNN2026.03 | 1.12 | 0.14 | — | — | — | — | 0.16 | — | — | — | — | — | — | — | — | |
| A-SoftmaxObjective=A-Softmax, Backbone=ECAPA-TDNN2026.01 | 1.1222 | 0.1286 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ECAPA-TDNN (C=512)Params=6.2M, MACs=1.569G, RTF (x10^-3)=1.80, Model Scale=base2023.12 | 1.13 | 0.1118 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CFKDBitrate=12 kbps, Backbone=ECAPA-TDNN1024, lambda=402026.07 | 1.15 | 0.148 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| KDTeacher Model=ECAPA1024, Student Model=ECAPA400, Transfer Type=Homogeneous2026.01 | 1.159 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReDimNet-B0Params=1.0M, GMACs=0.43, Large-Margin Finetuning=Yes, Training Data=VoxCeleb2-dev2026.03 | 1.16 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TRKDTeacher Model=RN34, Student Model=RN18, Transfer Type=Homogeneous2026.01 | 1.212 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MSETeacher Model=ECAPA1024, Student Model=ECAPA400, Transfer Type=Homogeneous2026.01 | 1.229 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpeakerCard-1MRegime=retrieval-spec.2026.06 | 1.25 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NeXt-TDNN (C=192, B=1)Params=1.8M, MACs=0.478G, RTF (x10^-3)=0.63, Model Scale=mobile2023.12 | 1.31 | 0.1319 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Student (w/o KD)Teacher Model=ECAPA1024, Student Model=ECAPA400, Transfer Type=Homogeneous2026.01 | 1.351 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NeXt-TDNN-l(C=192, B=1)Params=1.6M, MACs=0.417G, RTF (x10^-3)=0.51, Model Scale=mobile2023.12 | 1.39 | 0.1304 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| COSTeacher Model=ECAPA1024, Student Model=ECAPA400, Transfer Type=Homogeneous2026.01 | 1.399 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientTDNN-MobileParams=2.4M, MACs=0.574G, RTF (x10^-3)=1.20, Model Scale=mobile2023.12 | 1.41 | 0.1247 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CFKDBitrate=6 kbps, Backbone=ECAPA-TDNN1024, lambda=402026.07 | 1.53 | 0.196 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ECAPA-TDNN (C=256)Params=1.9M, MACs=0.410G, RTF (x10^-3)=1.60, Model Scale=mobile2023.12 | 1.56 | 0.1551 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TRKDTeacher Model=CAM++, Student Model=X-vector, Transfer Type=Heterogeneous2026.01 | 1.595 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OriginalBackbone=ECAPA-TDNN2026.06 | 1.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| x-vectorInput features=mel-spectrogram, Input duration=3 seconds2024.01 | 1.81 | 0.1251 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SA-TinyLLaMAScoring=Log-likelihood based scoring2026.03 | 1.87 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Fast ResNet-34Params=1.4M, MACs=0.675G, RTF (x10^-3)=1.67, Model Scale=mobile2023.12 | 2.08 | 0.2729 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Codec-ASV (M5)Bitrate=18 kbps, Backbone=ECAPA-TDNN10242026.07 | 2.08 | 0.307 | — | — | — | — | — | — | — | — | — | — | — | — | — |