Audio Deepfake Detection on ASVspoof DF 2021 (EER)
1.43EERMamBo-4-Hydra-N1
Evaluation Results
| Method | Links | |
|---|---|---|
| MamBo-4-Hydra-N1Params (M)=318.022026.01 | 1.43 | |
| Tran et al.Backbone=XLS-R, Backbone status=Fine-tuned, Layers used=25 (gated), Trainable params=318M§, Fusion=Gated2026.06 | 1.53 | |
| XLSR-Nes2NetXLoss Function=QAMO2025.09 | 1.6 | |
| XLSR-Conformer-TCMLoss Function=QAMO2025.09 | 1.63 | |
| MamBo-3-Hydra-N3Params (M)=319.372026.01 | 1.7 | |
| Fake-Mamba (L)Params (M)=319.722026.01 | 1.74 | |
| XLSR-MambaTraining Strategy=DPDA training + PCGrad2025.09 | 1.74 | |
| HyperPotterParams (M)=317.872026.02 | 1.78 | |
| W2V2-AASISTTraining Protocol=Protocol 2 (multi-dataset), Model Scale=317M2026.03 | 1.78 | |
| XLSR-Nes2NetXLoss Function=WCE, experimental_setting=Original2025.09 | 1.78 | |
| XLSR-Nes2Net-X2025.09 | 1.78 | |
| XLSR-Conformer-TCMTraining Strategy=DPDA training + PCGrad2025.09 | 1.81 | |
| mHuBERT-FinalTraining Protocol=Protocol 2 (multi-dataset), Model Scale=100M2026.03 | 1.83 | |
| MamBo-2-Hydra-N1Params (M)=316.682026.01 | 1.84 | |
| XLS-R+STCA+LMDC2026.02 | 1.87 | |
| XLSR-AASISTTraining Strategy=DPDA training2025.09 | 1.87 | |
| XLSR+MambaParams (M)=3192026.02 | 1.88 | |
| XLSR-MambaParams (M)=319.332026.01 | 1.88 | |
| MoLEXTraining Protocol=Protocol 2 (multi-dataset), Model Scale=376M2026.03 | 1.88 | |
| XLSR-MambaLoss Function=WCE2025.09 | 1.88 | |
| XLSR-Conformer-NACLLoss Function=WCE2025.09 | 1.88 | |
| XLSR-MambaTraining Strategy=Baseline2025.09 | 1.88 | |
| XLSR-Conformer-TCMLoss Function=OC-Softmax2025.09 | 1.89 | |
| XLSR+SLSParams (M)=3402026.02 | 1.91 | |
| XLSR-SLSParams (M)=341.492026.01 | 1.92 | |
| XLSR-SLS2025.09 | 1.92 | |
| XLS-R + HierConBackbone=XLS-R 300M, Head=HierCon2026.02 | 1.93 | |
| Wav2DF-TSL2025.09 | 1.95 | |
| MamBo-1-Mamba2-N2Params (M)=317.482026.01 | 2.01 | |
| XLSR-Conformer+TCMParams (M)=319.772026.01 | 2.06 | |
| XLSR-Conformer-TCMLoss Function=WCE, experimental_setting=Original2025.09 | 2.06 | |
| XLSR-Conformer-TCMTraining Strategy=Baseline2025.09 | 2.06 | |
| XLS-R + SLSBackbone=XLS-R, Head=SLS2026.02 | 2.09 | |
| XLSR-Conformer-TCMTraining Strategy=DPDA training2025.09 | 2.11 | |
| XLSR-AASISTTraining Strategy=DPDA training + PCGrad2025.09 | 2.13 | |
| XLSR+Conformer+TCMParams (M)=3192026.02 | 2.15 | |
| OC+ACS2026.02 | 2.19 | |
| ASC+OCLoss Function=WCE2025.09 | 2.19 | |
| OCKD2026.02 | 2.27 | |
| XLSR-ConformerParams (M)=319.742026.01 | 2.27 | |
| XLSR-Nes2NetXLoss Function=OC-Softmax2025.09 | 2.29 | |
| XLSR-MambaTraining Strategy=DPDA training2025.09 | 2.31 | |
| XLSR+BiCrossMambaParams (M)=318.212026.02 | 2.35 | |
| mHuBERT-Iter2Training Protocol=Protocol 2 (multi-dataset), Model Scale=100M2026.03 | 2.37 | |
| XLSR-Conformer-TCMLoss Function=WCE, experimental_setting=Reproduced2025.09 | 2.39 | |
| XLSR+MoE2026.02 | 2.54 | |
| XLSR-MoE2025.09 | 2.54 | |
| WavLM+MFA2026.02 | 2.56 | |
| WavLM+MFABackbone=WavLM, Head=MFA2026.02 | 2.56 | |
| XLSR+ConformerParams (M)=302.402026.02 | 2.58 | |
| XLSR-ConformerLoss Function=WCE2025.09 | 2.58 | |
| XLSR-Nes2NetXLoss Function=WCE, experimental_setting=Reproduced2025.09 | 2.76 | |
| XLSR+AASIST22026.02 | 2.77 | |
| Wav2Vec+AASIST2Backbone=Wav2Vec, Head=AASIST22026.02 | 2.77 | |
| FTDKD2026.02 | 2.82 | |
| Wav2Vec+AASISTBackbone=Wav2Vec, Head=AASIST2026.02 | 2.85 | |
| W2V2-TCMTraining Protocol=Protocol 2 (multi-dataset), Model Scale=319M2026.03 | 2.91 | |
| WavLM+AttMBackbone=WavLM, Head=AttM2026.02 | 3.19 | |
| Probing-Guided Layer SelectionBackbone=XLS-R, Backbone status=Frozen, Layers used=4, Trainable params=1.34M, Fusion=Concat2026.06 | 3.23 | |
| DF-Arena 500MTraining Protocol=Protocol 2 (multi-dataset), Model Scale=500M2026.03 | 3.3 | |
| XLSR-AASIST-SAM2025.09 | 3.44 | |
| WavLM-Base+Training Protocol=Protocol 2 (multi-dataset), Model Scale=100M2026.03 | 3.59 | |
| Wav2Vec+LinearBackbone=Wav2Vec, Head=Linear2026.02 | 3.65 | |
| HuBERT-BaseTraining Protocol=Protocol 2 (multi-dataset), Model Scale=100M2026.03 | 3.68 | |
| XLSR-AASISTTraining Strategy=Baseline2025.09 | 3.69 | |
| ResembleAI-2BTraining Protocol=Protocol 2 (multi-dataset), Model Scale=2000M2026.03 | 3.79 | |
| WavLM-BaseTraining Protocol=Protocol 2 (multi-dataset), Model Scale=100M2026.03 | 3.93 | |
| MLDG-LoRABackbone=W2V 2.0, Backbone status=LoRA, Layers used=All, Trainable params=3.59M, Fusion=Feature2026.06 | 3.99 | |
| Wav2Vec2+AASIST(Baseline)Params (M)=317.842026.02 | 4.08 | |
| WavLM+ASPBackbone=WavLM, Head=ASP2026.02 | 4.47 | |
| mHuBERT-Iter1Training Protocol=Protocol 2 (multi-dataset), Model Scale=100M2026.03 | 4.53 | |
| DF-Arena 100M-V1Training Protocol=Protocol 2 (multi-dataset), Model Scale=100M2026.03 | 5.5 | |
| Wav2Vec2+AASISTParams (M)=317.842026.02 | 6.63 | |
| Dual-Granularity Orthogonal DisentanglementFine-tuning status=without fine-tuning, Variant=Full Model2026.06 | 7.88 | |
| WavLM-MLPPre-training (SSL-based)=true, Model Parameters=>300M, Fine-tuning status=without fine-tuning2026.06 | 7.95 | |
| Dual-Granularity Orthogonal Disentanglement (Cosine Only)Fine-tuning status=without fine-tuning, Variant=Cosine Only2026.06 | 8.23 | |
| DG-AggFine-tuning status=without fine-tuning2026.06 | 8.26 | |
| Wav2Vec2-AASISTPre-training (SSL-based)=true, Model Parameters=>300M, Fine-tuning status=without fine-tuning2026.06 | 8.54 | |
| GRL BaselineFine-tuning status=without fine-tuning2026.06 | 8.91 | |
| Dual-Granularity Orthogonal Disentanglement (No Disentangle)Fine-tuning status=without fine-tuning, Variant=No Disentangle2026.06 | 9.05 | |
| Res-TSSDNetFine-tuning status=without fine-tuning2026.06 | 9.81 | |
| Dual-Granularity Orthogonal Disentanglement (Single Branch)Fine-tuning status=without fine-tuning, Variant=Single Branch2026.06 | 10.17 | |
| RawGAT-STFine-tuning status=without fine-tuning2026.06 | 10.75 | |
| AASISTFine-tuning status=without fine-tuning2026.06 | 12.83 | |
| BiCrossMamba-STParams (M)=0.5162026.01 | 14.77 | |
| RawBMambaParams (M)=0.7192026.01 | 15.85 | |
| RawMambaParams (M)=0.7192026.01 | 22.48 |