Phrase Grounding on Flickr30k (test)
87.5AccuracyMM1.5-30B
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| MM1.5-30BModel Size Category=Larger (>13B)2024.09 | 87.5 | — | — | — | — | |
| Ferret-V2-13BModel Size Category=Larger (>13B)2024.09 | 86.3 | — | — | — | — | |
| MM1.5-3BModel Size Category=3B2024.09 | 85.9 | — | — | — | — | |
| MM1.5-3B-MoEModel Size Category=3B, Architecture=MoE2024.09 | 85.8 | — | — | — | — | |
| Ferret-V2-7BModel Size Category=7B2024.09 | 85.8 | — | — | — | — | |
| MM1.5-1B-MoEModel Size Category=1B, Architecture=MoE2024.09 | 85.4 | — | — | — | — | |
| MM1.5-7BModel Size Category=7B2024.09 | 85.3 | — | — | — | — | |
| Ferret-13BModel Size Category=Larger (>13B)2024.09 | 84.8 | — | — | — | — | |
| BARE-LVisual Encoder=BEiT-L [9], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained open-set detection model, Training dataset scope=mixed datasets2026.01 | 83.68 | — | — | — | — | |
| MM1.5-1BModel Size Category=1B2024.09 | 83 | — | — | — | — | |
| Ferret-7BModel Size Category=7B2024.09 | 82.2 | — | — | — | — | |
| InternVL2Model Size Category=3B2024.09 | 51.6 | — | — | — | — | |
| LLaVA-OneVision-7BModel Size Category=7B2024.09 | 50.1 | — | — | — | — | |
| Phi-3-Vision-4BModel Size Category=3B2024.09 | 27.12 | — | — | — | — | |
| MM1-1BModel Size Category=1B2024.09 | 0 | — | — | — | — | |
| MM1-3BModel Size Category=3B2024.09 | 0 | — | — | — | — | |
| MM1-7BModel Size Category=7B2024.09 | 0 | — | — | — | — | |
| MM1-30BModel Size Category=Larger (>13B)2024.09 | 0 | — | — | — | — | |
| 12-in-1training=multi-task2019.12 | — | 64.61 | — | — | — | |
| DDPNObject Detector=w/, Model Size=Base2022.05 | — | — | 73.5 | — | — | |
| G-DINO-T(c)Pre-Train Data=O365, GoldG, Cap4M2024.01 | — | 88.1 | — | 96.9 | 98.2 | |
| GLIP-TPre-Train Data=O365, GoldG2024.01 | — | 85.6 | — | 95.4 | 96.7 | |
| GLIP-TPre-Train Data=O365, GoldG, CC3M, SBU2024.01 | — | 86 | — | 95.9 | 97.2 | |
| HDCtraining=multi-task2019.12 | — | 57.39 | — | — | — | |
| MDETRObject Detector=w/o, Model Size=Base2022.05 | — | — | 83.8 | — | — | |
| MM-G-T(b)Pre-Train Data=O365, GoldG2024.01 | — | 86.2 | — | 95.7 | 97.4 | |
| MM-G-T(c1)Pre-Train Data=O365, GoldG, GRIT2024.01 | — | 87 | — | 96.2 | 97.7 | |
| MM-G-T(c2)Pre-Train Data=O365, GoldG, GRIT2024.01 | — | 87 | — | 96.2 | 97.7 | |
| MM-G-T(c3)Pre-Train Data=O365, GoldG, GRIT, V3Det2024.01 | — | 87.2 | — | 96.2 | 97.7 | |
| PEVLObject Detector=w/o, Model Size=Base2022.05 | — | — | 84.4 | — | — | |
| UniTABObject Detector=w/o, Model Size=Base2022.05 | — | — | 79.6 | — | — |