Multimodal Named Entity Recognition on Twitter-GMNER
91.89F1 ScorePLIM Mix
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| PLIM MixText Encoder=XLM-RoBERTa-large, LLM Backbone=Mix2024.06 | 91.89 | 91.12 | 92.67 | |
| PLIM ChatGPTText Encoder=XLM-RoBERTa-large, LLM Backbone=ChatGPT2024.06 | 91.43 | 90.86 | 92.01 | |
| PLIM LlaMA2-13BText Encoder=XLM-RoBERTa-large, LLM Backbone=LlaMA2-13B2024.06 | 90.84 | 89.57 | 92.15 | |
| PLIM LlaMA2-7BText Encoder=XLM-RoBERTa-large, LLM Backbone=LlaMA2-7B2024.06 | 90.66 | 90.12 | 91.19 | |
| PLIM Vicuna-7BText Encoder=XLM-RoBERTa-large, LLM Backbone=Vicuna-7B2024.06 | 90.3 | 89.35 | 91.27 | |
| PLIM Vicuna-13BText Encoder=XLM-RoBERTa-large, LLM Backbone=Vicuna-13B2024.06 | 90.2 | 90.16 | 90.23 | |
| MoRewiki-ImageText Encoder=XLM-RoBERTa-large2024.06 | 89.82 | — | — | |
| ITAText Encoder=XLM-RoBERTa-large2024.06 | 89.75 | — | — | |
| PLIM MixText Encoder=BERT-base, LLM Backbone=Mix2024.06 | 89.71 | 89.24 | 90.19 | |
| PLIM ChatGPTText Encoder=BERT-base, LLM Backbone=ChatGPT2024.06 | 89.58 | 89.09 | 90.08 | |
| MoRewiki-TextText Encoder=XLM-RoBERTa-large2024.06 | 89.5 | — | — | |
| XLMRlarge-CRFText Encoder=XLM-RoBERTa-large, Modality=Text only2024.06 | 89.34 | 88.46 | 90.23 | |
| PLIM LlaMA2-7BText Encoder=BERT-base, LLM Backbone=LlaMA2-7B2024.06 | 88.04 | 87.27 | 88.82 | |
| PLIM Vicuna-7BText Encoder=BERT-base, LLM Backbone=Vicuna-7B2024.06 | 87.8 | 88.26 | 87.34 | |
| PLIM Vicuna-13BText Encoder=BERT-base, LLM Backbone=Vicuna-13B2024.06 | 87.46 | 87.11 | 87.82 | |
| PLIM LlaMA2-13BText Encoder=BERT-base, LLM Backbone=LlaMA2-13B2024.06 | 87.31 | 86.74 | 87.89 | |
| R-GCNText Encoder=BERT-base2024.06 | 87.11 | 86.72 | 87.53 | |
| MoRewiki-TextText Encoder=BERT-base2024.06 | 86.34 | 85.92 | 86.75 | |
| CAT-MNERText Encoder=BERT-base2024.06 | 85.99 | 87.04 | 84.97 | |
| RiVEGBackbone=XLM-R, Data Augmentation=true2024.06 | 85.94 | 85.71 | 86.16 | |
| MoRewiki-ImageText Encoder=BERT-base2024.06 | 85.94 | 85.49 | 86.38 | |
| RiVEGModality=Text+Image, Backbone=XLM-R, Data Augmentation=true2024.02 | 85.94 | 85.71 | 86.16 | |
| ITAText Encoder=BERT-base2024.06 | 85.72 | — | — | |
| UMGFText Encoder=BERT-base2024.06 | 85.51 | 86.54 | 84.5 | |
| UMTText Encoder=BERT-base2024.06 | 85.31 | 85.28 | 85.34 | |
| BERTbase-CRFText Encoder=BERT-base, Modality=Text only2024.06 | 84.96 | 86.1 | 83.85 | |
| RiVEGBackbone=XLM-R, Data Augmentation=false2024.06 | 84.51 | 84.8 | 84.23 | |
| RiVEGModality=Text+Image, Backbone=XLM-R, Data Augmentation=false2024.02 | 84.51 | 84.8 | 84.23 | |
| RiVEGBackbone=BERT, Data Augmentation=true2024.06 | 84.19 | 83.02 | 85.4 | |
| RiVEGModality=Text+Image, Backbone=BERT, Data Augmentation=true2024.02 | 84.19 | 83.02 | 85.4 | |
| RiVEGBackbone=BERT, Data Augmentation=false2024.06 | 82.89 | 83.12 | 82.66 | |
| RiVEGModality=Text+Image, Backbone=BERT, Data Augmentation=false2024.02 | 82.89 | 83.12 | 82.66 | |
| Qwen2.5VL-7B + MRSI + CVOType=End-to-End, Method=MRSI + CVO2026.02 | 82.8 | 82.6 | 82.9 | |
| MimoVL-7B + MRSI + CVOType=End-to-End, Method=MRSI + CVO2026.02 | 82.3 | 82.2 | 82.5 | |
| Qwen2.5VL-7BType=End-to-End, Supervised Fine-Tuning=true2026.02 | 82.2 | 83 | 81.3 | |
| Qwen2.5VL-7B + MRSIType=End-to-End, Method=MRSI2026.02 | 81.8 | 82.4 | 81.2 | |
| UnCoType=Pipeline2026.02 | 81.7 | — | — | |
| MimoVL-7B + MRSIType=End-to-End, Method=MRSI2026.02 | 81.1 | 81.5 | 80.8 | |
| QGNVenue=-, Visual Backbone=ViT-B/322026.03 | 80.52 | 79.84 | 81.21 | |
| MQSPNVenue=AAAI’25, Visual Backbone=ViT-B/32+VinVL2026.03 | 80.43 | 79.66 | 81.22 | |
| BARTMNER-VinVL-EVGType=Pipeline2026.02 | 80.4 | 80.7 | 80.1 | |
| MQSPNType=Unified2026.02 | 80.4 | 81.2 | 79.7 | |
| BARTMNER-VinVL-EVGBackbone=BARTMNER-VinVL-EVG2024.06 | 80.39 | 80.65 | 80.14 | |
| BARTMNER-VinVL-EVGModality=Text+Image, Visual Backbone=VinVL2024.02 | 80.39 | 80.65 | 80.14 | |
| TIGERType=Unified2026.02 | 80.3 | 79.9 | 80.1 | |
| TIGERVenue=ACM’23, Visual Backbone=VinVL2026.03 | 80.28 | 80.7 | 79.88 | |
| BARTNER-NoneModality=Text2024.02 | 79.83 | 79.67 | 79.98 | |
| MimoVL-7BType=End-to-End, Supervised Fine-Tuning=true2026.02 | 79.8 | 81.7 | 78 | |
| H-Index2024.06 | 79.73 | 79.37 | 80.1 | |
| H-IndexModality=Text+Image2024.02 | 79.73 | 79.37 | 80.1 | |
| H-IndexVenue=ACL’23, Visual Backbone=VinVL2026.03 | 79.73 | 80.1 | 79.37 | |
| H-IndexType=Unified2026.02 | 79.7 | 79.4 | 80.1 | |
| ITA-VinVL-EVGVenue=NAACL’22, Visual Backbone=VinVL2026.03 | 79.57 | 78.37 | 80.4 | |
| MNER-QGVenue=AAAI’23, Visual Backbone=DN53 + FPN2026.03 | 79.57 | 78.59 | 78.16 | |
| PLIM MixText Encoder=XLM-RoBERTa-large, LLM Backbone=Mix2024.06 | 79.44 | 79.1 | 79.78 | |
| ITA-VinVL-EVGType=Pipeline2026.02 | 79.4 | 80.4 | 78.4 | |
| ITA-VinVL-EVGBackbone=ITA-VinVL-EVG2024.06 | 79.37 | 80.4 | 78.37 | |
| ITA-VinVL-EVGModality=Text+Image, Visual Backbone=VinVL2024.02 | 79.37 | 80.4 | 78.37 | |
| PLIM ChatGPTText Encoder=XLM-RoBERTa-large, LLM Backbone=ChatGPT2024.06 | 79.33 | 79.21 | 79.45 | |
| UMGF-VinVL-EVGVenue=AAAI’21, Visual Backbone=RN152+VinVL2026.03 | 79.15 | 80.28 | 79.02 | |
| PLIM LlaMA2-13BText Encoder=XLM-RoBERTa-large, LLM Backbone=LlaMA2-13B2024.06 | 79.1 | 78.37 | 79.86 | |
| PLIM LlaMA2-7BText Encoder=XLM-RoBERTa-large, LLM Backbone=LlaMA2-7B2024.06 | 78.86 | 78.16 | 79.57 | |
| UMGF-VinVL-EVGBackbone=UMGF-VinVL-EVG2024.06 | 78.83 | 79.02 | 78.64 | |
| UMGF-VinVL-EVGModality=Text+Image, Visual Backbone=VinVL2024.02 | 78.83 | 79.02 | 78.64 | |
| PLIM Vicuna-13BText Encoder=XLM-RoBERTa-large, LLM Backbone=Vicuna-13B2024.06 | 78.69 | 78.46 | 78.92 | |
| UMT-RCNN-EVGBackbone=UMT-RCNN-EVG2024.06 | 78.58 | 77.89 | 79.28 | |
| UMT-VinVL-EVGBackbone=UMT-VinVL-EVG2024.06 | 78.58 | 77.89 | 79.28 | |
| UMT-RCNN-EVGModality=Text+Image, Visual Backbone=RCNN2024.02 | 78.58 | 77.89 | 79.28 | |
| UMT-VinVL-EVGModality=Text+Image, Visual Backbone=VinVL2024.02 | 78.58 | 77.89 | 79.28 | |
| UMT-RCNN-EVGVenue=ACL’20, Visual Backbone=RN152+VinVL2026.03 | 78.58 | 79.28 | 77.89 | |
| UMT-VinVL-EVGVenue=ACL’20, Visual Backbone=RN152+VinVL2026.03 | 78.58 | 79.28 | 77.89 | |
| MNER-QGType=Unified2026.02 | 78.4 | 78.2 | 78.6 | |
| PLIM Vicuna-7BText Encoder=XLM-RoBERTa-large, LLM Backbone=Vicuna-7B2024.06 | 78.17 | 76.97 | 79.42 | |
| MoRewiki-ImageText Encoder=XLM-RoBERTa-large2024.06 | 78.13 | — | — | |
| ITAText Encoder=XLM-RoBERTa-large2024.06 | 78.03 | — | — | |
| BERT-CRF-NoneModality=Text2024.02 | 77.93 | 77.23 | 78.64 | |
| MoRewiki-TextText Encoder=XLM-RoBERTa-large2024.06 | 77.91 | — | — | |
| XLMRlarge-CRFText Encoder=XLM-RoBERTa-large, Modality=Text only2024.06 | 77.32 | 76.45 | 78.22 | |
| BERT-NoneModality=Text2024.02 | 77.3 | 77.26 | 77.41 | |
| PLIM MixText Encoder=BERT-base, LLM Backbone=Mix2024.06 | 76.97 | 75.92 | 78.04 | |
| PLIM ChatGPTText Encoder=BERT-base, LLM Backbone=ChatGPT2024.06 | 76.79 | 75.84 | 77.76 | |
| GVATT-RCNN-EVGModality=Text+Image, Visual Backbone=RCNN2024.02 | 76.26 | 78.21 | 74.39 | |
| GVATT-RCNN-EVGVenue=ACL’18, Visual Backbone=RN152+VinVL2026.03 | 76.26 | 74.39 | 78.21 | |
| PLIM Vicuna-7BText Encoder=BERT-base, LLM Backbone=Vicuna-7B2024.06 | 76.18 | 74.7 | 77.72 | |
| PLIM LlaMA2-13BText Encoder=BERT-base, LLM Backbone=LlaMA2-13B2024.06 | 76.08 | 74.75 | 77.45 | |
| PLIM Vicuna-13BText Encoder=BERT-base, LLM Backbone=Vicuna-13B2024.06 | 75.86 | 74.95 | 76.8 | |
| PLIM LlaMA2-7BText Encoder=BERT-base, LLM Backbone=LlaMA2-7B2024.06 | 75.69 | 74.87 | 76.53 | |
| ITAText Encoder=BERT-base2024.06 | 75.6 | — | — | |
| HBILSTM-CRF-NoneModality=Text2024.02 | 75.58 | 78.8 | 72.61 | |
| CAT-MNERText Encoder=BERT-base2024.06 | 75.41 | 76.19 | 74.65 | |
| R-GCNText Encoder=BERT-base2024.06 | 75 | 73.95 | 76.18 | |
| UMGFText Encoder=BERT-base2024.06 | 74.85 | 74.49 | 75.21 | |
| BERTbase-CRFText Encoder=BERT-base, Modality=Text only2024.06 | 74.71 | 75.56 | 73.88 | |
| MoRewiki-ImageText Encoder=BERT-base2024.06 | 73.89 | 73.16 | 74.64 | |
| MoRewiki-TextText Encoder=BERT-base2024.06 | 73.86 | 73.31 | 74.43 | |
| UMTText Encoder=BERT-base2024.06 | 73.41 | 71.67 | 75.23 | |
| Qwen2.5VL-7B + MRSI + CVOType=End-to-End, Method=MRSI + CVO2026.02 | 70.6 | 70.5 | 70.8 | |
| MimoVL-7B + MRSI + CVOType=End-to-End, Method=MRSI + CVO2026.02 | 69.6 | 69.4 | 69.7 | |
| Qwen2.5VL-7B + MRSIType=End-to-End, Method=MRSI2026.02 | 68.6 | 69.1 | 68.1 | |
| SCANNERType=Pipeline2026.02 | 68.5 | 68.3 | 68.7 |