Deepfake Detection on CDF v2 (video-level AUC)
96Video-level AUCGenD (CLIP)
Evaluation Results
| Method | Links | |
|---|---|---|
| GenD (CLIP)Input=Frame, Backbone=CLIP ViT-L/14, Training Dataset=FF++2025.08 | 96 | |
| LOGERInput=Frame, Backbone=DINOv3+MetaCLIP22026.04 | 95.9 | |
| GenD (PE)Input=Frame, Backbone=PEcoreL, Training Dataset=FF++2025.08 | 95.8 | |
| GenD-PETraining Data=FF++, Evaluation Protocol=Video-level2026.05 | 95.8 | |
| ForAdaInput=Frame, Backbone=CLIP ViT-L/142026.04 | 95.7 | |
| ForAdaInput=Frame, Backbone=CLIP ViT-L/14, Training Dataset=FF++2025.08 | 95.7 | |
| ForAdaTraining Data=FF++, Evaluation Protocol=Video-level2026.05 | 95.7 | |
| EffortInput=Frame, Backbone=CLIP ViT-L/142026.04 | 95.6 | |
| EffortInput=Frame, Backbone=CLIP ViT-L/14, Training Dataset=FF++2025.08 | 95.6 | |
| RAEInput=Frame, Backbone=ViT-B/162026.04 | 95.5 | |
| RAEInput=Frame, Backbone=ViT-B/16, Training Dataset=FF++2025.08 | 95.5 | |
| LAA-NetInput=Frame, Backbone=EfficientNet-B42026.04 | 95.4 | |
| LAA-NetInput=Frame, Backbone=EFNB4, Training Dataset=FF++2025.08 | 95.4 | |
| FS-VFMTraining Data=FF++, Evaluation Protocol=Video-level2026.05 | 95.4 | |
| DFD-FCGInput=Video, Backbone=CLIP ViT-L/142026.04 | 95 | |
| DFD-FCGInput=Video, Backbone=CLIP ViT-L/14, Training Dataset=FF++2025.08 | 95 | |
| P&PInput=Video, Backbone=CLIP ViT-L/142026.04 | 94.7 | |
| P&PInput=Video, Backbone=CLIP ViT-L/14, Training Dataset=FF++2025.08 | 94.7 | |
| SBIInput=Frame, Backbone=EfficientNet-B42026.04 | 93.2 | |
| SBIInput=Frame, Backbone=EFNB4, Training Dataset=FF++2025.08 | 93.2 | |
| EffortTraining Data=FF++, Evaluation Protocol=Video-level2026.05 | 93.2 | |
| UDDInput=Frame, Backbone=CLIP ViT-B/162026.04 | 93.1 | |
| UDDInput=Frame, Backbone=CLIP ViT-B/16, Training Dataset=FF++2025.08 | 93.1 | |
| AUNetInput=Video, Backbone=Xception2026.04 | 92.8 | |
| AUNetInput=Video, Backbone=Xception+ART, Training Dataset=FF++2025.08 | 92.8 | |
| ProDetInput=Frame, Backbone=EfficientNet-B42026.04 | 92.5 | |
| ProDetInput=Frame, Backbone=EFNB4, Training Dataset=FF++2025.08 | 92.5 | |
| GenDInput=Frame, Backbone=DINOv3 ViT-L/162026.04 | 92.2 | |
| GenD (DINO)Input=Frame, Backbone=DINOv3 ViT-L/16, Training Dataset=FF++2025.08 | 92.2 | |
| TALL++Input=Video, Backbone=Swin-B2026.04 | 92 | |
| TALL++Input=Video, Backbone=Swin-B, Training Dataset=FF++2025.08 | 92 | |
| LSDAInput=Frame, Backbone=EfficientNet-B42026.04 | 91.1 | |
| LSDAInput=Frame, Backbone=EFNB4, Training Dataset=FF++2025.08 | 91.1 | |
| FSFMTraining Data=FF++, Evaluation Protocol=Video-level2026.05 | 90.3 | |
| BlenDTraining Data=25k ScaleDF (real) + SBI fakes, Evaluation Protocol=Video-level2026.05 | 90 | |
| AltFreezingInput=Video, Backbone=3D ResNet-502026.04 | 89.5 | |
| NACOInput=Video, Backbone=ViT-B/162026.04 | 89.5 | |
| AltFreezingInput=Video, Backbone=3D ResNet-50, Training Dataset=FF++2025.08 | 89.5 | |
| NACOInput=Video, Backbone=ViT-B/16, Training Dataset=FF++2025.08 | 89.5 | |
| StyleDFDInput=Video, Backbone=3D ResNet-50, Training Dataset=FF++2025.08 | 89 | |
| FSBITraining Data=FF++ with pseudo-fakes, Evaluation Protocol=Video-level2026.05 | 88.2 | |
| FTCNInput=Video, Backbone=3D ResNet-502026.04 | 86.9 | |
| RealForensicsInput=Video, Backbone=Modified CSN2026.04 | 86.9 | |
| FTCNInput=Video, Backbone=3D ResNet-50, Training Dataset=FF++2025.08 | 86.9 | |
| RealForensicsInput=Video, Backbone=Modified CSN, Training Dataset=FF++2025.08 | 86.9 | |
| SBITraining Data=FF++ with pseudo-fakes, Evaluation Protocol=Video-level2026.05 | 86.2 | |
| LipForensicsInput=Video, Backbone=ResNet-182026.04 | 82.4 | |
| LipForensicsInput=Video, Backbone=ResNet-18, Training Dataset=FF++2025.08 | 82.4 |