Binary Hate Detection on FHM (test)
78.6AccuracyGPT-4
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT-4Training=false, RAG=true2026.03 | 78.6 | — | — | |
| LLaVA (Vicuna 13B)Training=true2026.03 | 77.3 | — | — | |
| GPT-4o w/ ARCADETraining=false2026.03 | 75.31 | 81.4 | 76.8 | |
| GPT-5-mini w/ ARCADETraining=false2026.03 | 74.69 | 83.47 | 76.81 | |
| GPT-4oTraining=false2026.03 | 73.8 | 77.6 | 74.76 | |
| Qwen-VL-Max w/ ARCADETraining=false2026.03 | 73.7 | 77.5 | 74.7 | |
| Qwen3-VL-Plus w/ ARCADETraining=false2026.03 | 73.49 | 83.4 | 75.99 | |
| Spark-VLTraining=false, RAG=true2026.03 | 73.2 | — | — | |
| GPT-5-miniTraining=false2026.03 | 73 | 58 | 68.53 | |
| Qwen-VL-MaxTraining=false, RAG=true2026.03 | 72.8 | — | — | |
| Pro-CapPromptHateTraining=true2026.03 | 72.28 | — | — | |
| ALBEFTraining=true2026.03 | 70.58 | — | — | |
| Qwen-VL-MaxTraining=false2026.03 | 70.39 | 64.88 | 68.71 | |
| Qwen3-VL-PlusTraining=false2026.03 | 69.77 | 54.96 | 64.56 | |
| BLIPTraining=true2026.03 | 69.2 | — | — | |
| PromptHateTraining=true2026.03 | 67.82 | — | — | |
| MMBT-RegionTraining=true2026.03 | 65.06 | — | — | |
| ViLBERT CCTraining=true2026.03 | 64.7 | — | — | |
| DisMultiHateTraining=true2026.03 | 62.42 | — | — | |
| LLAVA-1.5 7BTraining=false2026.03 | 60 | — | — | |
| CLIP-BERTTraining=true2026.03 | 58.28 | — | — | |
| Text BERTTraining=true2026.03 | 57.12 | — | — | |
| INSTRUCTBLIP VICUNA 7BTraining=false2026.03 | 53.06 | — | — | |
| Image RegionTraining=true2026.03 | 52.34 | — | — | |
| IDEFICS 9BTraining=false2026.03 | 49.8 | — | — |