Audio Deepfake Detection on WaveFake
97.2AccuracyWhisper DF
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Whisper DFTrain=MLAAD v12026.06 | 97.2 | — | — | |
| FlowFakeTrain=MLAAD v12026.06 | 90.41 | — | — | |
| SSL W2V2Train=ITW2026.06 | 70.4 | — | — | |
| SSL W2V2Train=MLAAD v12026.06 | 69.8 | — | — | |
| RawGAT-STTrain=MLAAD v12026.06 | 68.4 | — | — | |
| RawGAT-STTrain=ITW2026.06 | 65.3 | — | — | |
| SSL W2V2Train=ASV192026.06 | 51.3 | — | — | |
| Whisper DFTrain=ITW2026.06 | 26.3 | — | — | |
| FlowFakeTrain=FoR2026.06 | 20.13 | — | — | |
| RawGAT-STTrain=FoR2026.06 | 20 | — | — | |
| CAFNetZero-shot=true, Trained on=MLADDC T22026.05 | 17.3 | 0.4948 | 50.38 | |
| RawGAT-STTrain=ASV192026.06 | 15 | — | — | |
| SSL W2V2Train=FoR2026.06 | 10.4 | — | — | |
| Whisper DFTrain=ASV192026.06 | 2.2 | — | — | |
| Whisper DFTrain=FoR2026.06 | 0.2 | — | — | |
| AASIST2026.06 | — | — | 18.8 | |
| Probing-Guided Layer SelectionBackbone=XLS-R, Backbone status=Frozen, Layers used=4, Trainable params=1.34M, Fusion=Concat2026.06 | — | — | 3.76 | |
| RawGAT2026.06 | — | — | 32.1 | |
| RawNet22026.06 | — | — | 36.5 | |
| RawNet32026.06 | — | — | 40.8 | |
| W2V2-layer24Layer count=242026.06 | — | — | 27 | |
| W2V2-layer7Layer count=72026.06 | — | — | 3.4 |