Audio Deepfake Detection on Codecfake (EER)
1.94EERSATYAM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SATYAMEvaluation Protocol=Proposed2026.04 | 1.94 | 99.11 | |
| SATYAM with Qwen2-1.8BEvaluation Protocol=Proposed, LLM=Qwen2-1.8B2026.04 | 2.11 | 98.32 | |
| W + T + Qwen2-7B (H-BD-SS)Evaluation Protocol=Proposed, Backbone=Whisper + TRILLsson, LLM=Qwen2-7B2026.04 | 2.42 | 97.34 | |
| W + T + Qwen2-7B (H-BD-ST)Evaluation Protocol=Proposed, Backbone=Whisper + TRILLsson, LLM=Qwen2-7B2026.04 | 2.69 | 97.22 | |
| W + T + Qwen2-7B (E-BD)Evaluation Protocol=Proposed, Backbone=Whisper + TRILLsson, LLM=Qwen2-7B2026.04 | 3.68 | 96.47 | |
| W + T + Qwen2-7B(MA)Evaluation Protocol=Proposed, Backbone=Whisper + TRILLsson, LLM=Qwen2-7B2026.04 | 4.07 | 95.31 | |
| W + T + Qwen2-7B (C)Evaluation Protocol=Proposed, Backbone=Whisper + TRILLsson, LLM=Qwen2-7B2026.04 | 4.39 | 95.75 | |
| Qwen2 audio-baseEvaluation Protocol=Fine-Tuning ALM2026.04 | 5.6 | 95.55 | |
| T + Qwen2-7BEvaluation Protocol=Proposed, Backbone=TRILLsson, LLM=Qwen2-7B2026.04 | 5.83 | 95.1 | |
| W + Qwen2-7BEvaluation Protocol=Proposed, Backbone=Whisper, LLM=Qwen2-7B2026.04 | 6.02 | 94.64 | |
| DF-Arena 500MTraining Protocol=Protocol 2 (multi-dataset)2026.03 | 6.36 | — | |
| MiOEvaluation Protocol=Pre-Trained Backbone2026.04 | 6.49 | 95.11 | |
| W + T (CA)Evaluation Protocol=Pre-Trained Backbone, Backbone=Whisper + TRILLsson, Fusion=Cross-attention2026.04 | 7.01 | 94.99 | |
| W + T (LF)Evaluation Protocol=Pre-Trained Backbone, Backbone=Whisper + TRILLsson, Fusion=Late-Fusion2026.04 | 7.19 | 94.83 | |
| Wav2vec2-AASISTEvaluation Protocol=Pre-Trained Backbone, Backbone=Wav2vec22026.04 | 7.29 | 94.45 | |
| W-LCCNEvaluation Protocol=Pre-Trained Backbone, Backbone=Whisper2026.04 | 7.92 | 93.38 | |
| DF-Arena 100M-V1Training Protocol=Protocol 2 (multi-dataset)2026.03 | 8.74 | — | |
| AASISTEvaluation Protocol=End-to-end2026.04 | 10.13 | 94.21 | |
| mHuBERT-Iter1Training Protocol=Protocol 2 (multi-dataset)2026.03 | 13.34 | — | |
| W2V2-AASISTTraining Protocol=Protocol 2 (multi-dataset)2026.03 | 13.35 | — | |
| W2V2-TCMTraining Protocol=Protocol 2 (multi-dataset)2026.03 | 13.7 | — | |
| WavLM-Base+Training Protocol=Protocol 2 (multi-dataset)2026.03 | 13.79 | — | |
| mHuBERT-Iter2Training Protocol=Protocol 2 (multi-dataset)2026.03 | 14.04 | — | |
| HuBERT-BaseTraining Protocol=Protocol 2 (multi-dataset)2026.03 | 14.77 | — | |
| WavLM-BaseTraining Protocol=Protocol 2 (multi-dataset)2026.03 | 18.55 | — | |
| RACL Diffusionreconstruction_method=SemantiCodec, aggregation=multi-layer, regularization=RACL2026.04 | 20.198 | — | |
| Agg Diffusionreconstruction_method=SemantiCodec, aggregation=multi-layer2026.04 | 21.061 | — | |
| mHuBERT-FinalTraining Protocol=Protocol 2 (multi-dataset)2026.03 | 25.68 | — | |
| Diffusionreconstruction_method=SemantiCodec2026.04 | 27.063 | — | |
| Encodecreconstruction_method=Encodec2026.04 | 29.816 | — | |
| MoLEXTraining Protocol=Protocol 2 (multi-dataset)2026.03 | 32.4 | — | |
| ResembleAI-2BTraining Protocol=Protocol 2 (multi-dataset)2026.03 | 33.04 | — | |
| XLSR+SLSParams (M)=3402026.02 | 33.43 | — | |
| HyperPotterParams (M)=317.872026.02 | 34.47 | — | |
| XLSR+MambaParams (M)=3192026.02 | 35.26 | — | |
| XLSR+Conformer+TCMParams (M)=3192026.02 | 36.01 | — | |
| Baselineimplementation=authors' implementation2026.04 | 36.799 | — | |
| XLSR+BiCrossMambaParams (M)=318.212026.02 | 37.7 | — | |
| HiFi-GANreconstruction_method=HiFi-GAN2026.04 | 39.616 | — | |
| DACreconstruction_method=DAC2026.04 | 39.972 | — | |
| Wav2Vec2+AASIST(Baseline)Params (M)=317.842026.02 | 40.22 | — | |
| Baseline*source=CodecFake paper [18]2026.04 | 41.583 | — | |
| Wav2Vec2+AASISTParams (M)=317.842026.02 | 43.36 | — | |
| Qwen2 audio-baseEvaluation Protocol=Zero-shot2026.04 | 81.26 | 17.91 | |
| Qwen2 audio-chatEvaluation Protocol=Zero-shot2026.04 | 82.33 | 16.74 | |
| Qwen-audio-baseEvaluation Protocol=Zero-shot2026.04 | 85.74 | 15.82 | |
| Qwen-audio-chatEvaluation Protocol=Zero-shot2026.04 | 86.61 | 13 | |
| Audioflamingo 3Evaluation Protocol=Zero-shot2026.04 | 90.85 | 10.22 | |
| Audioflamingo 2Evaluation Protocol=Zero-shot2026.04 | 92.1 | 8.41 | |
| PengiEvaluation Protocol=Zero-shot2026.04 | 94.97 | 5.68 |