Multimodal hate content localization on HateMM
64.5mAPMultiHateLoc
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MultiHateLocModality=V+A+T2025.12 | 64.5 | 79.9 | |
| MultiHateLocModality=V+A2025.12 | 62.1 | 78.1 | |
| MultiHateLocModality=T+A2025.12 | 61.7 | 77.7 | |
| MultiHateLocModality=V+T2025.12 | 61.2 | 77.5 | |
| CMFusionModality=V+A+T2025.12 | 59.6 | 76.3 | |
| Late FusionModality=V+A+T2025.12 | 57.8 | 77.9 | |
| Early FusionModality=V+A+T2025.12 | 56.5 | 76.5 | |
| VAD-CLIPModality=Audio2025.12 | 56.3 | 76.2 | |
| VAD-CLIPModality=V+T2025.12 | 55.9 | 76.1 | |
| VAD-CLIPModality=T+A2025.12 | 55 | 75.5 | |
| VAD-CLIPModality=V+A2025.12 | 54.6 | 75.2 | |
| VAD-CLIPModality=Video2025.12 | 53.1 | 74 | |
| VAD-CLIPModality=Text2025.12 | 49.8 | 71.2 |