Classification on MMAUD
99.3AccuracyAV-DTEC
Evaluation Results
| Method | Links | |
|---|---|---|
| AV-DTECYear=2024, Category (Training)=Self-Supervised, Modal (Inference)=Audio+Image2026.03 | 99.3 | |
| TAMEYear=2023, Category (Training)=Supervised, Modal (Inference)=Audio-Only2026.03 | 96 | |
| OursCategory (Training)=Zero-shot, Modal (Inference)=Image-Only2026.03 | 96 | |
| AV-FDTIYear=2024, Category (Training)=Supervised, Modal (Inference)=Audio+Image2026.03 | 92 | |
| AV-PEDYear=2023, Category (Training)=Self-Supervised, Modal (Inference)=Audio+Image2026.03 | 89.6 | |
| AAUTEYear=2025, Category (Training)=Self-Supervised, Modal (Inference)=Audio-Only2026.03 | 74.7 | |
| YOLO26Year=2026, Category (Training)=Supervised, Modal (Inference)=Image-Only2026.03 | 72 | |
| YOLOv10Year=2024, Category (Training)=Supervised, Modal (Inference)=Image-Only2026.03 | 65 | |
| YOLOv12Year=2025, Category (Training)=Supervised, Modal (Inference)=Image-Only2026.03 | 62 | |
| Lei et al.Year=2026, Category (Training)=Self-Supervised, Modal (Inference)=Audio+Image2026.03 | 56 |