Hateful Meme Detection on Hateful Memes (test)
0.828AUROCDisMultiHate
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DisMultiHatedisentanglement=true2021.08 | 0.828 | 75.8 | |
| HumanSource=-2020.12 | 0.8265 | — | |
| HumanType=Human2020.12 | 0.8265 | 84.7 | |
| EnsembleSource=Vilio2020.12 | 0.8252 | — | |
| PromptHateLearning Paradigm=Prompting, Backbone=RoBERTa-large, Training Objective=Masked Language Modeling2023.02 | 0.8145 | 72.98 | |
| DisMultiHate (w/o disentangle)disentanglement=false2021.08 | 0.814 | 73.6 | |
| EnsembleType=Ours2020.12 | 0.8108 | 76.5 | |
| ERNIE-ViL LargeSource=Vilio2020.12 | 0.8059 | — | |
| DisMultiHate2023.02 | 0.7989 | 71.26 | |
| VL-BERTaugmentation=entity tags and demographic info2021.08 | 0.788 | 71.4 | |
| ERNIE-ViLaugmentation=entity tags2021.08 | 0.787 | 69 | |
| UNITERSource=Vilio2020.12 | 0.7865 | — | |
| VILLNAaugmentation=entity tags2021.08 | 0.785 | 71.2 | |
| UNITERaugmentation=entity tags2021.08 | 0.78 | 68.6 | |
| OSCARSource=Vilio2020.12 | 0.773 | — | |
| ERNIE-ViL BaseSource=Vilio2020.12 | 0.7702 | — | |
| FT-ROBERTaLearning Paradigm=Fine-tuning, Backbone=RoBERTa-large2023.02 | 0.7632 | 67.72 | |
| VisualBERTSource=Vilio2020.12 | 0.7575 | — | |
| VisualBERT-COCOpre-training=COCO2021.08 | 0.74 | 65.1 | |
| VILBERTModality (Image)=true, Modality (Text)=true2022.04 | 0.734 | — | |
| Visual BERTModality (Image)=true, Modality (Text)=true2022.04 | 0.732 | — | |
| VILBERT CCPre-training Dataset=Conceptual Captions (CC)2023.02 | 0.7305 | 64.7 | |
| MMBT-Region2023.02 | 0.7286 | 65.06 | |
| VILBERT CCModality (Image)=true, Modality (Text)=true2022.04 | 0.728 | — | |
| MMBT-RegionModality (Image)=true, Modality (Text)=true2022.04 | 0.722 | — | |
| VisualBERT COCOSource=Hateful Memes Baseline2020.12 | 0.7141 | — | |
| VisualBERT COCOType=Baseline2020.12 | 0.7141 | 64.73 | |
| VisualBERTSource=Hateful Memes Baseline2020.12 | 0.7133 | — | |
| VisualBERTType=Baseline2020.12 | 0.7133 | 63.2 | |
| ViLBERTmodality=multimodal2021.08 | 0.711 | 62.2 | |
| VisualBERTmodality=multimodal2021.08 | 0.706 | 62.1 | |
| VILBERTSource=Hateful Memes Baseline2020.12 | 0.7045 | — | |
| ViLBERTType=Baseline2020.12 | 0.7045 | 62.3 | |
| ViLTModality (Image)=true, Modality (Text)=true, Implementation=Author re-implementation2022.04 | 0.702 | — | |
| ViLBERT-CCpre-training=Conceptual Captions2021.08 | 0.701 | 61.4 | |
| VILBERT CCSource=Hateful Memes Baseline2020.12 | 0.7003 | — | |
| ViLBERT CCType=Baseline2020.12 | 0.7003 | 61.1 | |
| MOMENTA2023.02 | 0.6917 | 61.34 | |
| Visual BERT COCOPre-training Dataset=COCO2023.02 | 0.6871 | 61.48 | |
| MMBT-GridModality (Image)=true, Modality (Text)=true2022.04 | 0.673 | — | |
| CLIP BERTVisual Encoder=CLIP2023.02 | 0.6697 | 58.28 | |
| Concat BERTFusion Strategy=Concatenation2023.02 | 0.6653 | 60.8 | |
| Late FusionFusion Strategy=Late Fusion2023.02 | 0.6634 | 59.14 | |
| Text BERTModality=Text only2023.02 | 0.661 | 57.12 | |
| Input-level promptsMissing rate η=70%, Training Image=65%, Training Text=65%, Testing Image=65%, Testing Text=65%2023.03 | 0.6607 | — | |
| BERTunimodal=true2021.08 | 0.647 | 58.3 | |
| Attention-level promptsMissing rate η=70%, Training Image=65%, Training Text=65%, Testing Image=65%, Testing Text=65%2023.03 | 0.6455 | — | |
| DCPMissing rate η=90%, Image presence (%)=10%, Text presence (%)=100%2024.10 | 0.6387 | — | |
| Input-level promptsMissing rate η=70%, Training Image=30%, Training Text=100%, Testing Image=30%, Testing Text=100%2023.03 | 0.6306 | — | |
| UnimodalModality (Image)=false, Modality (Text)=true2022.04 | 0.627 | — | |
| BaselineMissing rate η=70%, Training Image=65%, Training Text=65%, Testing Image=65%, Testing Text=65%2023.03 | 0.6248 | — | |
| DePTMissing rate η=90%, Image presence (%)=10%, Text presence (%)=100%2024.10 | 0.6242 | — | |
| Attention-level promptsMissing rate η=70%, Training Image=30%, Training Text=100%, Testing Image=30%, Testing Text=100%2023.03 | 0.6234 | — | |
| Attention-level promptsMissing rate η=70%, Training Image=100%, Training Text=30%, Testing Image=100%, Testing Text=30%2023.03 | 0.6217 | — | |
| MaPLeMissing rate η=90%, Image presence (%)=10%, Text presence (%)=100%2024.10 | 0.6187 | — | |
| BaselineMissing rate η=70%, Training Image=30%, Training Text=100%, Testing Image=30%, Testing Text=100%2023.03 | 0.6164 | — | |
| MMPMissing rate η=90%, Image presence (%)=10%, Text presence (%)=100%2024.10 | 0.6152 | — | |
| CoOpMissing rate η=90%, Image presence (%)=10%, Text presence (%)=100%2024.10 | 0.6146 | — | |
| OursTraining Text Ratio=30%, Testing Text Ratio=30%, Training Image Ratio=100%, Testing Image Ratio=100%2022.04 | 0.612 | — | |
| BaselineMissing rate η=70%, Training Image=100%, Training Text=30%, Testing Image=100%, Testing Text=30%2023.03 | 0.6078 | — | |
| Image onlyModality=Image-only, Testing Text Ratio=0%2022.04 | 0.602 | — | |
| New baselineTraining Text Ratio=30%, Testing Text Ratio=30%, Training Image Ratio=100%, Testing Image Ratio=100%2022.04 | 0.597 | — | |
| Input-level promptsMissing rate η=70%, Training Image=100%, Training Text=30%, Testing Image=100%, Testing Text=30%2023.03 | 0.5911 | — | |
| ViLTModality (Image)=false, Modality (Text)=true, Implementation=Author re-implementation2022.04 | 0.583 | — | |
| Image-RegionModality=Image only2023.02 | 0.5669 | 52.34 | |
| ViLTModality (Image)=true, Modality (Text)=false, Implementation=Author re-implementation2022.04 | 0.563 | — | |
| UnimodalModality (Image)=true, Modality (Text)=false2022.04 | 0.546 | — | |
| KD2021.12 | — | 68.22 | |
| modality relation distillation paradigm2021.12 | — | 69.54 |