Grounded Multimodal Named Entity Recognition on Twitter-GMNER
75.63F1 ScoreSAKE
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| SAKECategory=LLM Agent, E2E=true, Using LLM=Qwen2.5-VL-7B2026.04 | 75.63 | — | — | 68.8 | 86.95 | 78.76 | |
| Qwen2.5VL-7B + MRSI + CVOType=End-to-End, Method=MRSI + CVO2026.02 | 73.4 | 73.2 | 73.5 | — | — | — | |
| MimoVL-7B + MRSI + CVOType=End-to-End, Method=MRSI + CVO2026.02 | 72.9 | 72.8 | 73.1 | — | — | — | |
| PGIM-ISR-OFACategory=Internal Knowledge Exploitation, E2E=false, Using LLM=Qwen2-VL-7B2026.04 | 72.35 | — | — | 0 | — | — | |
| MAKARCategory=LLM Agent, E2E=false, Using LLM=Qwen2.5-VL-7B2026.04 | 71.88 | — | — | 100 | 86.38 | 74.64 | |
| Qwen2.5VL-7B + MRSIType=End-to-End, Method=MRSI2026.02 | 71.5 | 72.1 | 71 | — | — | — | |
| RiVEGBackbone=XLM-R, Data Augmentation=true2024.06 | 70.01 | 69.97 | 70.06 | — | — | — | |
| RiVEGModality=Text+Image, Backbone=XLM-R, Data Augmentation=true2024.02 | 70.01 | 69.97 | 70.06 | — | — | — | |
| Qwen2.5-VL-7B (SFT+GRPO)*Category=Internal Knowledge Exploitation, E2E=true, Using LLM=Qwen2.5-VL-7B2026.04 | 69.74 | — | — | 0 | 82.58 | 73.08 | |
| UnCoType=Pipeline2026.02 | 69.6 | — | — | — | — | — | |
| MimoVL-7B + MRSIType=End-to-End, Method=MRSI2026.02 | 69.5 | 69.8 | 69.2 | — | — | — | |
| RiVEGBackbone=BERT, Data Augmentation=true2024.06 | 69.18 | 68.21 | 70.18 | — | — | — | |
| RiVEGModality=Text+Image, Backbone=BERT, Data Augmentation=true2024.02 | 69.18 | 68.21 | 70.18 | — | — | — | |
| Qwen2.5-VL-7B (MoRE)*Category=External Knowledge Exploration, E2E=false, Using LLM=Qwen2.5-VL-7B2026.04 | 69.01 | — | — | 100 | 82.67 | 72.25 | |
| RiVEGBackbone=XLM-R, Data Augmentation=false2024.06 | 68.79 | 67.97 | 69.63 | — | — | — | |
| RiVEGModality=Text+Image, Backbone=XLM-R, Data Augmentation=false2024.02 | 68.79 | 67.97 | 69.63 | — | — | — | |
| SCANNERCategory=External Knowledge Exploration, E2E=false, Using LLM=BLIP-22026.04 | 68.52 | — | — | 100 | — | — | |
| Qwen2.5-VL-7B (SFT)*Category=Supervised Fine-tuning, E2E=true, Using LLM=Qwen2.5-VL-7B2026.04 | 68.49 | — | — | 0 | 82.31 | 71.66 | |
| QGNVenue=-, Visual Backbone=ViT-B/322026.03 | 67.45 | 69.25 | 65.75 | — | — | — | |
| RiVEGBackbone=XLM-R, Data Augmentation=true2024.06 | 67.06 | 67.02 | 67.1 | — | — | — | |
| RiVEGModality=Text+Image, Backbone=XLM-R, Data Augmentation=true2024.02 | 67.06 | 67.02 | 67.1 | — | — | — | |
| RiVEGCategory=Internal Knowledge Exploitation, E2E=false, Using LLM=ChatGPT2026.04 | 67.06 | — | — | 0 | 85.94 | 70.01 | |
| RiVEGBackbone=BERT, Data Augmentation=false2024.06 | 66.92 | 67.16 | 66.68 | — | — | — | |
| RiVEGModality=Text+Image, Backbone=BERT, Data Augmentation=false2024.02 | 66.92 | 67.16 | 66.68 | — | — | — | |
| VKELCategory=External Knowledge Exploration, E2E=false, Using LLM=LLaVA-1.5-7B2026.04 | 66.87 | — | — | 100 | 83.75 | 70.43 | |
| RiVEGBackbone=BERT, Data Augmentation=true2024.06 | 66.02 | 65.1 | 66.96 | — | — | — | |
| RiVEGModality=Text+Image, Backbone=BERT, Data Augmentation=true2024.02 | 66.02 | 65.1 | 66.96 | — | — | — | |
| RiVEGBackbone=XLM-R, Data Augmentation=false2024.06 | 65.88 | 65.09 | 66.68 | — | — | — | |
| RiVEGModality=Text+Image, Backbone=XLM-R, Data Augmentation=false2024.02 | 65.88 | 65.09 | 66.68 | — | — | — | |
| MimoVL-7BType=End-to-End, Supervised Fine-Tuning=true2026.02 | 65.4 | 67 | 63.9 | — | — | — | |
| Qwen2.5VL-7BType=End-to-End, Supervised Fine-Tuning=true2026.02 | 65.1 | 65.8 | 64.4 | — | — | — | |
| UnCoCategory=Internal Knowledge Exploitation, E2E=false, Using LLM=Gemini-2.5 Pro2026.04 | 64.58 | — | — | 0 | 81.71 | 69.62 | |
| RiVEGBackbone=BERT, Data Augmentation=false2024.06 | 63.8 | 64.03 | 63.57 | — | — | — | |
| RiVEGModality=Text+Image, Backbone=BERT, Data Augmentation=false2024.02 | 63.8 | 64.03 | 63.57 | — | — | — | |
| MQSPNType=Unified2026.02 | 62.4 | 61.9 | 62.9 | — | — | — | |
| MQSPNVenue=AAAI’25, Visual Backbone=ViT-B/32+VinVL2026.03 | 62.4 | 62.94 | 61.86 | — | — | — | |
| GEMCategory=Internal Knowledge Exploitation, E2E=false, Using LLM=ChatGPT2026.04 | 61.54 | — | — | 0 | 84.81 | 64.49 | |
| TIGERType=Unified2026.02 | 61.3 | 60.7 | 61.8 | — | — | — | |
| TIGERVenue=ACM’23, Visual Backbone=VinVL2026.03 | 61.26 | 61.81 | 60.72 | — | — | — | |
| H-IndexType=Unified2026.02 | 61.2 | 60.9 | 61.5 | — | — | — | |
| H-Index2024.06 | 61.18 | 60.9 | 61.46 | — | — | — | |
| H-IndexModality=Text+Image2024.02 | 61.18 | 60.9 | 61.46 | — | — | — | |
| QGNVenue=-, Visual Backbone=ViT-B/322026.03 | 61.18 | 63.23 | 59.35 | — | — | — | |
| H-IndexVenue=ACL’23, Visual Backbone=VinVL2026.03 | 61.18 | 61.46 | 60.9 | — | — | — | |
| MQSPNVenue=AAAI’25, Visual Backbone=ViT-B/32+VinVL2026.03 | 59.03 | 58.76 | 58.49 | — | — | — | |
| MQSPNCategory=Supervised Fine-tuning, E2E=true2026.04 | 58.76 | — | — | 0 | 80.43 | 62.4 | |
| MNER-QGVenue=AAAI’23, Visual Backbone=DN53 + FPN2026.03 | 57.52 | 56.59 | 58.48 | — | — | — | |
| MNER-QGType=Unified2026.02 | 57.5 | 58.5 | 56.6 | — | — | — | |
| TIGERCategory=Supervised Fine-tuning, E2E=true2026.04 | 57.48 | — | — | 0 | — | — | |
| H-Index2024.06 | 56.41 | 56.16 | 56.67 | — | — | — | |
| H-IndexModality=Text+Image2024.02 | 56.41 | 56.16 | 56.67 | — | — | — | |
| H-IndexCategory=Supervised Fine-tuning, E2E=true2026.04 | 56.41 | — | — | 0 | 79.73 | 61.18 | |
| H-IndexVenue=ACL’23, Visual Backbone=VinVL2026.03 | 56.16 | 56.41 | 56.67 | — | — | — | |
| TIGERVenue=ACM’23, Visual Backbone=VinVL2026.03 | 55.84 | 56.63 | 57.45 | — | — | — | |
| UMGF-VinVL-EVGBackbone=UMGF-VinVL-EVG2024.06 | 55.74 | 55.68 | 55.8 | — | — | — | |
| UMGF-VinVL-EVGModality=Text+Image, Visual Backbone=VinVL2024.02 | 55.74 | 55.68 | 55.8 | — | — | — | |
| ITA-VinVL-EVGType=Pipeline2026.02 | 55.7 | 56.6 | 54.8 | — | — | — | |
| BARTMNER-VinVL-EVGType=Pipeline2026.02 | 55.7 | 55.7 | 55.6 | — | — | — | |
| ITA-VinVL-EVGBackbone=ITA-VinVL-EVG2024.06 | 55.69 | 56.57 | 54.84 | — | — | — | |
| ITA-VinVL-EVGModality=Text+Image, Visual Backbone=VinVL2024.02 | 55.69 | 56.57 | 54.84 | — | — | — | |
| ITA-VinVL-EVGVenue=NAACL’22, Visual Backbone=VinVL2026.03 | 55.69 | 54.84 | 55.68 | — | — | — | |
| BARTMNER-VinVL-EVGBackbone=BARTMNER-VinVL-EVG2024.06 | 55.66 | 55.68 | 55.63 | — | — | — | |
| BARTMNER-VinVL-EVGModality=Text+Image, Visual Backbone=VinVL2024.02 | 55.66 | 55.68 | 55.63 | — | — | — | |
| UMT-VinVL-EVGBackbone=UMT-VinVL-EVG2024.06 | 55.6 | 54.35 | 56.91 | — | — | — | |
| UMT-VinVL-EVGModality=Text+Image, Visual Backbone=VinVL2024.02 | 55.6 | 54.35 | 56.91 | — | — | — | |
| UMT-VinVL-EVGVenue=ACL’20, Visual Backbone=RN152+VinVL2026.03 | 55.6 | 56.91 | 54.35 | — | — | — | |
| UMGF-VinVL-EVGVenue=AAAI’21, Visual Backbone=RN152+VinVL2026.03 | 55.6 | 55.91 | 55.68 | — | — | — | |
| UMT-RCNN-EVGBackbone=UMT-RCNN-EVG2024.06 | 54.78 | 53.55 | 56.08 | — | — | — | |
| UMT-RCNN-EVGModality=Text+Image, Visual Backbone=RCNN2024.02 | 54.78 | 53.55 | 56.08 | — | — | — | |
| UMT-RCNN-EVGVenue=ACL’20, Visual Backbone=RN152+VinVL2026.03 | 54.78 | 56.08 | 53.55 | — | — | — | |
| GVATT-RCNN-EVGModality=Text+Image, Visual Backbone=RCNN2024.02 | 53.32 | 54.19 | 52.48 | — | — | — | |
| GVATT-RCNN-EVGVenue=ACL’18, Visual Backbone=RN152+VinVL2026.03 | 53.32 | 52.48 | 54.19 | — | — | — | |
| GLM4.5VLType=End-to-End, Chain-of-Thought=true, Few-shot=3-Shot2026.02 | 53.1 | 47.2 | 60.7 | — | — | — | |
| MNER-QGVenue=AAAI’23, Visual Backbone=DN53 + FPN2026.03 | 53.02 | 53.91 | 54.84 | — | — | — | |
| BARTMNER-VinVL-EVGBackbone=BARTMNER-VinVL-EVG2024.06 | 52.45 | 52.43 | 52.47 | — | — | — | |
| BARTMNER-VinVL-EVGModality=Text+Image, Visual Backbone=VinVL2024.02 | 52.45 | 52.47 | 52.43 | — | — | — | |
| MMT5 / BART-OD-EVGCategory=Supervised Fine-tuning, E2E=false2026.04 | 52.45 | — | — | 0 | 80.39 | 55.66 | |
| ITA-VinVL-EVGVenue=NAACL’22, Visual Backbone=VinVL2026.03 | 52.37 | 51.56 | 50.77 | — | — | — | |
| UMGF-VinVL-EVGBackbone=UMGF-VinVL-EVG2024.06 | 51.67 | 51.62 | 51.72 | — | — | — | |
| UMGF-VinVL-EVGModality=Text+Image, Visual Backbone=VinVL2024.02 | 51.67 | 51.62 | 51.72 | — | — | — | |
| UMGF-OD-EVGCategory=Supervised Fine-tuning, E2E=false2026.04 | 51.67 | — | — | 0 | 78.83 | 55.74 | |
| UMGF-VinVL-EVGVenue=AAAI’21, Visual Backbone=RN152+VinVL2026.03 | 51.62 | 51.67 | 51.72 | — | — | — | |
| ITA-VinVL-EVGBackbone=ITA-VinVL-EVG2024.06 | 51.56 | 52.37 | 50.77 | — | — | — | |
| ITA-VinVL-EVGModality=Text+Image, Visual Backbone=VinVL2024.02 | 51.56 | 52.37 | 50.77 | — | — | — | |
| ITA-OD-EVGCategory=Supervised Fine-tuning, E2E=false2026.04 | 51.56 | — | — | 0 | 79.37 | 55.69 | |
| UMT-VinVL-EVGBackbone=UMT-VinVL-EVG2024.06 | 51.31 | 50.15 | 52.52 | — | — | — | |
| UMT-VinVL-EVGModality=Text+Image, Visual Backbone=VinVL2024.02 | 51.31 | 50.15 | 52.52 | — | — | — | |
| UMT-RCNN-EVGBackbone=UMT-RCNN-EVG2024.06 | 50.29 | 49.16 | 51.48 | — | — | — | |
| UMT-RCNN-EVGModality=Text+Image, Visual Backbone=RCNN2024.02 | 50.29 | 49.16 | 51.48 | — | — | — | |
| UMT-OD-EVGCategory=Supervised Fine-tuning, E2E=false2026.04 | 50.29 | — | — | 0 | 78.58 | 54.78 | |
| UMT-VinVL-EVGVenue=ACL’20, Visual Backbone=RN152+VinVL2026.03 | 50.15 | 51.31 | 52.52 | — | — | — | |
| GVATT-RCNN-EVGVenue=ACL’18, Visual Backbone=RN152+VinVL2026.03 | 49.36 | 48.57 | 47.8 | — | — | — | |
| GLM4.5VLType=End-to-End, Chain-of-Thought=true2026.02 | 49.2 | 44.6 | 54.8 | — | — | — | |
| UMT-RCNN-EVGVenue=ACL’20, Visual Backbone=RN152+VinVL2026.03 | 49.16 | 50.29 | 51.48 | — | — | — | |
| BARTNER-NoneModality=Text2024.02 | 48.99 | 48.77 | 49.23 | — | — | — | |
| GVATT-RCNN-EVGModality=Text+Image, Visual Backbone=RCNN2024.02 | 48.57 | 49.36 | 47.8 | — | — | — | |
| BERT-CRF-NoneModality=Text2024.02 | 48.07 | 46.92 | 49.28 | — | — | — | |
| BERT-NoneModality=Text2024.02 | 47.63 | 46.76 | 48.52 | — | — | — | |
| HBILSTM-CRF-NoneModality=Text2024.02 | 47.49 | 49.17 | 45.92 | — | — | — | |
| Qwen2.5VL-72BType=End-to-End, Chain-of-Thought=true, Few-shot=3-Shot2026.02 | 45.6 | 37.2 | 58.8 | — | — | — |