Deepfake Detection on FakeAVCeleb
0.8304Video-level AUCSUR-LID
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| SUR-LIDTraining Protocol=Protocol 12024.11 | 0.8304 | 0.7663 | — | — | |
| multi-branch framework (Ours)Evaluation Protocol=zero-shot2026.05 | 0.8303 | — | — | — | |
| MM-DetInput Modalities=Text+Visual, Evaluation Protocol=zero-shot2026.05 | 0.7674 | — | — | — | |
| HDPTraining Protocol=Protocol 12024.11 | 0.6917 | 0.6535 | — | — | |
| DFILTraining Protocol=Protocol 12024.11 | 0.6306 | 0.6111 | — | — | |
| UMMAFormerInput Modalities=Visual+Audio, Evaluation Protocol=zero-shot2026.05 | 0.6229 | — | — | — | |
| Lower BoundTraining Protocol=Protocol 12024.11 | 0.5995 | 0.5841 | — | — | |
| BA-TFD+Input Modalities=Visual+Audio, Evaluation Protocol=zero-shot2026.05 | 0.517 | — | — | — | |
| BA-TFDInput Modalities=Visual+Audio, Evaluation Protocol=zero-shot2026.05 | 0.4927 | — | — | — | |
| Audio-onlyCondition=Clean2026.04 | — | — | — | 0.814 | |
| Audio-onlyCondition=JPEG2026.04 | — | — | — | 0.809 | |
| DeepAgentModality=Audio + Video + Text, Architecture=CNN + DNN + RF, Fusion=Feature + Decision, AV Consistency=Explicit AV lexical & semantic, Cross-dataset=Yes2025.12 | — | — | 0.9749 | — | |
| LAVACondition=Clean2026.04 | — | — | — | 1 | |
| LAVACondition=JPEG2026.04 | — | — | — | 0.81 | |
| Naïve fusionCondition=Clean2026.04 | — | — | — | 0.958 | |
| Naïve fusionCondition=JPEG2026.04 | — | — | — | 0.792 | |
| Usmani et al.Modality=Audio + Video, Architecture=STKD-VViT, Fusion=Feature-level, AV Consistency=Implicit, Cross-dataset=No2025.12 | — | — | 0.96 | — | |
| Visual-onlyCondition=Clean2026.04 | — | — | — | 0.833 | |
| Visual-onlyCondition=JPEG2026.04 | — | — | — | 0.565 |