Speaker Identification on VoxCeleb1
97.5AccuracyATST-C2F
Evaluation Results
| Method | Links | |
|---|---|---|
| ATST-C2F# Param=86M, Pre-training data=AS, knowledge distillation=true2023.06 | 97.5 | |
| ATST-C2FFine-tuning=true2024.06 | 97.5 | |
| ATST-Frame# Param=86M, Pre-training data=AS2023.06 | 97.3 | |
| ATST-FrameFine-tuning=true2024.06 | 97.3 | |
| MSM-MAEFine-tuning=true, # Params=86M, Masking ratio=0.752024.04 | 96.6 | |
| M2DFine-tuning=true, # Params=86M, Masking ratio=0.6, Target input strategy=all patches to target2024.04 | 96.6 | |
| MSM-MAEFine-tuning=true, masking ratio=0.752024.06 | 96.6 | |
| M2DFine-tuning=true, # Params=86M, Masking ratio=0.62024.04 | 96.5 | |
| M2DFine-tuning=true, masking ratio=0.62024.06 | 96.5 | |
| SpeechT52021.10 | 96.49 | |
| M2DFine-tuning=true, # Params=86M, Masking ratio=0.72024.04 | 96.3 | |
| M2DFine-tuning=true, masking ratio=0.72024.06 | 96.3 | |
| M2DFine-tuning=true, # Params=86M, Masking ratio=0.7, Target input strategy=all patches to target2024.04 | 96 | |
| XLS-RNumber of Parameters=0.3B2021.11 | 95.8 | |
| ATST-Clip# Param=86M, Pre-training data=AS2023.06 | 95.5 | |
| ATST-F2C# Param=86M, Pre-training data=AS, knowledge distillation=true2023.06 | 95.5 | |
| ATST-ClipFine-tuning=true2024.06 | 95.5 | |
| M2D-CLAPFine-tuning=true, masking ratio=0.72024.06 | 95.5 | |
| MSM-MAEEvaluation protocol=Fine-tuning2022.10 | 95.3 | |
| MSM-MAE# Param=86M, Pre-training data=AS2023.06 | 95.3 | |
| Audio-MAE (local)Evaluation protocol=Fine-tuning2022.10 | 94.8 | |
| M2DEvaluation protocol=Fine-tuning, Masking ratio=0.62022.10 | 94.8 | |
| Audio-MAE (local)# Param=86M, Pre-training data=AS2023.06 | 94.8 | |
| Audio-MAE (local)Fine-tuning=true, # Params=86M2024.04 | 94.8 | |
| M2DEvaluation protocol=Fine-tuning, Masking ratio=0.72022.10 | 94.4 | |
| M2D# Param=86M, Pre-training data=AS2023.06 | 94.4 | |
| ATST BaseEvaluation protocol=Fine-tuning2022.10 | 94.3 | |
| ATST BaseFine-tuning=true, # Params=86M2024.04 | 94.3 | |
| Baseline2021.10 | 91.92 | |
| HuBERT LARGEFramework=SUPERB, Protocol=Freeze encoder, Size=LARGE2021.10 | 90.33 | |
| SUPERB-Hubert Large2021.11 | 90.3 | |
| Thin ResNet-342021.10 | 89 | |
| SpeechNetMode=Multi-Task with TTS2021.10 | 87.9 | |
| SpeechNetMode=Single Task2021.10 | 86 | |
| WavTokenizerToken Category=Baseline (acoustic)2026.01 | 82.7 | |
| HuBERT BASEFramework=SUPERB, Protocol=Freeze encoder, Size=BASE2021.10 | 81.42 | |
| SSAST-FRAME# Param=89M, Pre-training data=AS+LS2023.06 | 80.8 | |
| SSASTFine-tuning=true, # Params=89M2024.04 | 80.8 | |
| CNN2021.11 | 80.5 | |
| wav2vec 2.0 BASEFramework=SUPERB, Protocol=Freeze encoder, Size=BASE2021.10 | 75.18 | |
| ATST-BaseEvaluation protocol=Linear evaluation2022.04 | 72 | |
| SSAST 250/400Evaluation protocol=Fine-tuning2022.10 | 66.6 | |
| SSAST-PATCH# Param=89M, Pre-training data=AS+LS2023.06 | 64.2 | |
| MAE-AST Patch/FrameEvaluation protocol=Fine-tuning2022.10 | 63.3 | |
| MAE-AST-FRAME# Param=86M, Pre-training data=AS+LS2023.06 | 63.3 | |
| MAE-ASTFine-tuning=true, # Params=86M2024.04 | 63.3 | |
| ASIT# Param=85M, Pre-training data=AS2023.06 | 63.1 | |
| DeLoRes-MEvaluation protocol=Fine-tuning2022.10 | 62 | |
| DeLoRes-MFine-tuning=true, # Params=5.3M2024.04 | 62 | |
| ATST-SmallEvaluation protocol=Linear evaluation2022.04 | 61.9 | |
| Voc-onlyToken Category=Single-task Optimized, alpha (α)=12026.01 | 49 | |
| BYOL-AEvaluation protocol=Linear evaluation2022.04 | 40.1 | |
| COLAEvaluation protocol=Linear evaluation2022.04 | 29.9 | |
| Phonological TokenizerToken Category=Proposed, alpha (α)=0.12026.01 | 29.5 | |
| SpeechTokenizerToken Category=Baseline (hybrid)2026.01 | 29.1 | |
| Discrete WavLMToken Category=Baseline (phonetic)2026.01 | 27.7 | |
| ASR-onlyToken Category=Single-task Optimized, alpha (α)=02026.01 | 20.6 | |
| TRILLEvaluation protocol=Linear evaluation2022.04 | 17.9 |