Speaker Identification on SID
94.8AccuracyAudio-MAE (local)
Evaluation Results
| Method | Links | |
|---|---|---|
| Audio-MAE (local)Backbone=ViT-B, PT-Data=AS2022.07 | 94.8 | |
| Audio-MAE (global)Backbone=ViT-B, PT-Data=AS2022.07 | 94.1 | |
| HuBERTEvaluation protocol=Frozen setting2021.10 | 81.4 | |
| HuBERTBackbone=Transformer, PT-Data=LS, Evaluation Protocol=Linear Evaluation2022.07 | 81.4 | |
| HuBERTfrozen setting=true2024.05 | 81.4 | |
| SSAST-FramePre-training data=AudioSet + Librispeech, Patch type=Frame-based2021.10 | 80.8 | |
| Wav2vec 2.0Evaluation protocol=Frozen setting2021.10 | 75.2 | |
| wav2vec 2.0Backbone=Transformer, PT-Data=LS, Evaluation Protocol=Linear Evaluation2022.07 | 75.2 | |
| Wav2Vec 2.0frozen setting=true2024.05 | 75.2 | |
| SSAMBA-base2024.05 | 70.1 | |
| SSAMBAModel size=base, Pretrained=true, Head learning rate=normal2024.05 | 70.1 | |
| SSASTModel size=base, Pretrained=true, Head learning rate=normal2024.05 | 68.8 | |
| SSAMBA-small2024.05 | 67.9 | |
| SSAMBAModel size=small, Pretrained=true, Head learning rate=larger2024.05 | 67.9 | |
| SSASTModel size=small, Pretrained=true, Head learning rate=larger2024.05 | 67 | |
| SSAMBA-tiny2024.05 | 66.1 | |
| SSAMBAModel size=tiny, Pretrained=true, Head learning rate=larger2024.05 | 66.1 | |
| SSAST-PatchPre-training data=AudioSet + Librispeech, Patch type=Patch-based2021.10 | 64.3 | |
| SS-ASTBackbone=ViT-B, PT-Data=AS+LS2022.07 | 64.3 | |
| SSASTModel size=tiny, Pretrained=true, Head learning rate=larger2024.05 | 64.3 | |
| MAE-ASTBackbone=ViT-B, PT-Data=AS+LS2022.07 | 63.3 | |
| SSAST-PatchPre-training data=Librispeech Only, Patch type=Patch-based2021.10 | 60.8 | |
| APCPre-training framework=Generative/Autoregressive2021.10 | 60.4 | |
| APC2024.05 | 60.4 | |
| Wav2vecPre-training framework=Discriminative2021.10 | 56.6 | |
| Wav2Vec2024.05 | 56.6 | |
| SSAMBAModel size=base, Pretrained=false, Head learning rate=normal2024.05 | 53.6 | |
| SSAMBAModel size=small, Pretrained=false, Head learning rate=larger2024.05 | 51.5 | |
| SSAMBAModel size=tiny, Pretrained=false, Head learning rate=larger2024.05 | 50.1 | |
| ASTBackbone=DeiT-B, PT-Data=IN2022.07 | 41.1 |