Multimodal hate content localization on MultiHateClip
0.445mAPMultiHateLoc
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MultiHateLocModality=V+A+T2025.12 | 0.445 | 0.75 | |
| CMFusionModality=V+A+T2025.12 | 0.42 | 0.672 | |
| MultiHateLocModality=V+A2025.12 | 0.414 | 0.676 | |
| Early FusionModality=V+A+T2025.12 | 0.41 | 0.662 | |
| MultiHateLocModality=T+A2025.12 | 0.408 | 0.669 | |
| VAD-CLIPModality=Audio2025.12 | 0.405 | 0.65 | |
| MultiHateLocModality=V+T2025.12 | 0.404 | 0.663 | |
| Late FusionModality=V+A+T2025.12 | 0.401 | 0.66 | |
| VAD-CLIPModality=V+T2025.12 | 0.393 | 0.631 | |
| VAD-CLIPModality=T+A2025.12 | 0.385 | 0.62 | |
| VAD-CLIPModality=V+A2025.12 | 0.38 | 0.623 | |
| VAD-CLIPModality=Text2025.12 | 0.367 | 0.61 | |
| VAD-CLIPModality=Video2025.12 | 0.348 | 0.605 |