Audio Deepfake Detection on ASVspoof LA 2019 (eval)
0.0007EERPT-Wav2Vec2-FT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PT-Wav2Vec2-FTTraining Data=CoRS (DEC Balance), Model Backbone=PT-Wav2Vec2-FT, Augmentation=RawBoost, Loss Function=CE loss2026.06 | 0.0007 | — | |
| DSFATraining Data=CoRS (DEC Balance), Model Backbone=PT-Wav2Vec2-FT, Augmentation=RawBoost+DSFA, Loss Function=CE+SupCon2026.06 | 0.0007 | — | |
| DSFATraining Data=CoRS (DEC Balance), Model Backbone=PT-Wav2Vec2-FT, Augmentation=RawBoost+DSFA, Loss Function=CE loss2026.06 | 0.0008 | — | |
| Tran et al.Backbone=XLS-R, Backbone status=Fine-tuned, Layers used=25 (gated), Trainable params=318M§, Fusion=Gated2026.06 | 0.001 | — | |
| PT-Wav2Vec2Training Data=None, Model Backbone=PT-Wav2Vec2, Augmentation=RawBoost, Loss Function=CE loss2026.06 | 0.0011 | — | |
| Wav2Vec2-AASISTTraining Data=ASVspoof19, Model Backbone=Wav2Vec2-AASIST, Augmentation=RawBoost, Loss Function=CE loss2026.06 | 0.0012 | — | |
| PT-Wav2Vec2-FTTraining Data=CoRS (DEC Balance), Model Backbone=PT-Wav2Vec2-FT, Augmentation=RawBoost, Loss Function=CE+SupCon2026.06 | 0.0019 | — | |
| Wav2Vec2-AASISTTraining Data=CoRS (Top3) + ASV19, Model Backbone=Wav2Vec2-AASIST, Augmentation=RawBoost, Loss Function=CE loss2026.06 | 0.0053 | — | |
| MLDG-LoRABackbone=W2V 2.0, Backbone status=LoRA, Layers used=All, Trainable params=3.59M, Fusion=Feature2026.06 | 0.0054 | — | |
| Wav2Vec2-AASISTTraining Data=CoRS (Top3), Model Backbone=Wav2Vec2-AASIST, Augmentation=RawBoost, Loss Function=CE loss2026.06 | 0.011 | — | |
| Wav2Vec2-AASISTTraining Data=CoRS (DEC Balance), Model Backbone=Wav2Vec2-AASIST, Augmentation=RawBoost, Loss Function=CE loss2026.06 | 0.0151 | — | |
| Wav2Vec2-AASISTTraining Data=CoRS (QUA Balance), Model Backbone=Wav2Vec2-AASIST, Augmentation=RawBoost, Loss Function=CE loss2026.06 | 0.0193 | — | |
| Wav2Vec2-AASISTTraining Data=CoRS (AUX Balance), Model Backbone=Wav2Vec2-AASIST, Augmentation=RawBoost, Loss Function=CE loss2026.06 | 0.0218 | — | |
| Probing-Guided Layer SelectionBackbone=XLS-R, Backbone status=Frozen, Layers used=4, Trainable params=1.34M, Fusion=Concat2026.06 | 0.0322 | — | |
| Xiao & VuBackbone=XLS-R, Backbone status=Frozen, Layers used=25, Trainable params=~25×cls, Fusion=Decision (sum)2026.06 | 0.0527 | — | |
| Baseline*source=CodecFake paper [18]2026.04 | 0.122 | — | |
| Diffusionreconstruction_method=SemantiCodec2026.04 | 0.166 | — | |
| HiFi-GANreconstruction_method=HiFi-GAN2026.04 | 0.201 | — | |
| RACL Diffusionreconstruction_method=SemantiCodec, aggregation=multi-layer, regularization=RACL2026.04 | 0.206 | — | |
| Baselineimplementation=authors' implementation2026.04 | 0.216 | — | |
| Agg Diffusionreconstruction_method=SemantiCodec, aggregation=multi-layer2026.04 | 0.288 | — | |
| Encodecreconstruction_method=Encodec2026.04 | 0.295 | — | |
| WavLM-MLPModel Scale=>300M parameters, Pre-training=SSL-based2026.06 | 0.43 | 0.0148 | |
| Wav2Vec2-AASISTModel Scale=>300M parameters, Pre-training=SSL-based2026.06 | 0.52 | 0.0165 | |
| AASISTModel Scale=≤5M parameters2026.06 | 0.83 | 0.0275 | |
| DACreconstruction_method=DAC2026.04 | 1.01 | — | |
| RawGAT-STModel Scale=≤5M parameters2026.06 | 1.06 | 0.0335 | |
| Dual-Granularity Orthogonal Disentanglement (Full Model)Model Scale=≤5M parameters2026.06 | 1.35 | 0.0208 | |
| Cosine OnlyModel Scale=≤5M parameters2026.06 | 1.5 | 0.022 | |
| Res-TSSDNetModel Scale=≤5M parameters2026.06 | 1.64 | 0.048 | |
| DG-AggModel Scale=≤5M parameters2026.06 | 1.87 | 0.0382 | |
| LCNN BaselineModel Scale=≤5M parameters2026.06 | 5 | 0.051 | |
| LFCC-LCNNModel Scale=≤5M parameters2026.06 | 5.06 | 0.1 | |
| RawNet2Model Scale=≤5M parameters2026.06 | 5.13 | 0.1175 | |
| GRL BaselineModel Scale=≤5M parameters2026.06 | 5.3 | 0.067 | |
| LFCC-GMMModel Scale=≤5M parameters2026.06 | 8.09 | 0.2116 |