Visual Question Answering on OKVQA
75.29Top-1 AccuracyCont-Squeeze (128 -> 1)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Cont-Squeeze (128 -> 1)Optimization steps=+200 steps2026.02 | 75.29 | — | |
| In-Squeeze (128 ... -> 1)Optimization mode=Standard2026.02 | 74.94 | — | |
| AuroraEdge-V-2BNumber of parameters=2B2026.01 | 73.95 | — | |
| Cont-Squeeze (128 -> 1)Optimization steps=+700 steps2026.02 | 73.88 | — | |
| Cont-Squeeze (128 -> 1)Optimization steps=+0 steps2026.02 | 73.71 | — | |
| In-Squeeze (128 ... -> 1)Optimization mode=Min steps2026.02 | 73.71 | — | |
| Direct Fine-tuning (r=1)Optimization steps=+200 steps2026.02 | 73.35 | — | |
| Direct Fine-tuning (r=1)Optimization steps=+0 steps2026.02 | 73.06 | — | |
| Direct Fine-tuning (r=1)Optimization steps=+700 steps2026.02 | 72.35 | — | |
| MMICLshots=42024.01 | 72 | — | |
| MAD-RAGModel Family=Qwen3-VL-8B2026.01 | 69.19 | — | |
| MAD-RAGModel Family=Qwen3-VL-4B2026.01 | 67.67 | — | |
| Vanilla RAGModel Family=Qwen3-VL-8B2026.01 | 67.03 | — | |
| CaMML-13Bshots=32024.01 | 66.3 | — | |
| PALI-X-55BModel Category=task-specific fine-tuning models2023.12 | 66.1 | — | |
| Vanilla RAGModel Family=Qwen3-VL-4B2026.01 | 65.96 | — | |
| InfiMM-HDLLM=Vicuna-13B, In-house data=false2024.03 | 65.5 | — | |
| CaMML-7Bshots=32024.01 | 64.7 | — | |
| CogVLMModel Category=task-specific fine-tuning models2023.12 | 64.7 | — | |
| PaLI-17BType=Specialists, Evaluation Protocol=Fine-tuned2024.10 | 64.5 | — | |
| AnyMAL-70BBackbone LLM=LLaMA2-70B2024.06 | 64.2 | — | |
| RoboMambaLLM=2.7B, Res.=2242024.06 | 63.3 | — | |
| LLaVA-1.5+CoSLanguage=Vicuna-13B2024.03 | 62.9 | — | |
| InternVL-2.0Params (#trainable)=8B, Text Backbone=AR, Image Backbone=-2024.12 | 62.9 | — | |
| Closed-bookModel Family=Qwen3-VL-8B2026.01 | 62.79 | — | |
| Closed-bookModel Family=Qwen3-VL-4B2026.01 | 62.72 | — | |
| RoboMambaLLM=2.7B, Res.=3362024.06 | 62.7 | — | |
| Sphinx-2KLLM=LLAMA2-13B, In-house data=false2024.03 | 62.6 | — | |
| SPHINXLLM=7B, Res.=2242024.06 | 62.1 | — | |
| AIMv2architecture=ViT-3B/14, #patches=576, resolution=336px2024.11 | 61.7 | — | |
| AIMv2architecture=ViT-1B/14, #patches=576, resolution=336px2024.11 | 61.5 | — | |
| MonkeyLLM=Qwen-7B, In-house data=true2024.03 | 61.3 | — | |
| MonkeyLanguage=Qwen-7B2024.03 | 61.3 | — | |
| MonkeySource=CVPR’242024.07 | 61.3 | — | |
| MonkeyParameters=9.8B, Resolution=896x8962023.11 | 61.3 | — | |
| AIMv2architecture=ViT-H/14, #patches=576, resolution=336px2024.11 | 61.3 | — | |
| CogAgentModel Category=generalist models2023.12 | 61.2 | — | |
| LLaVA-1.5Language=Vicuna-13B2024.03 | 60.9 | — | |
| AIMv2architecture=ViT-L/14, #patches=576, resolution=336px2024.11 | 60.8 | — | |
| INF-LLaVASource=Ours2024.07 | 60.67 | — | |
| Fuyu-8BModel Category=generalist models2023.12 | 60.6 | — | |
| PaLM-E-12BIn-house data=true2024.03 | 60.1 | — | |
| Palm-EParameters=12B2023.11 | 60.1 | — | |
| SigLIParchitecture=ViT-So400M/14, #patches=7522024.11 | 60.1 | — | |
| OpenAI CLIParchitecture=ViT-L/14, #patches=5762024.11 | 60 | — | |
| AnyMAL-13BBackbone LLM=LLaMA2-13B2024.06 | 59.6 | — | |
| Pink2023.11 | 59.5 | — | |
| PinkSource=CVPR’242024.07 | 59.5 | — | |
| LLaVA(base)2025.03 | 59.41 | — | |
| MM1-30BShot=16, Model Scale=30B2024.03 | 59.3 | — | |
| MM1-30BShot=162024.03 | 59.3 | — | |
| SigLIParchitecture=ViT-L/14, #patches=5762024.11 | 59.3 | — | |
| BLIP-2Model Category=task-specific fine-tuning models2023.12 | 59.3 | — | |
| CogVLMLLM=Vicuna-7B, In-house data=true2024.03 | 58.9 | — | |
| OneLLM-7BBackbone LLM=LLaMA2-7B2024.06 | 58.9 | — | |
| OneLLMSource=CVPR’242024.07 | 58.9 | — | |
| LLAVA-HRSource=arXiv’242024.07 | 58.9 | — | |
| ArcanaType=Generalists, LLM=Vicuna (7B), Evaluation Protocol=In-domain, MM-LoRA trained during pretrain=true2024.10 | 58.9 | — | |
| CogVLMModel Category=generalist models2023.12 | 58.9 | — | |
| OneLLM-7BLLM=LLAMA2-7B2023.12 | 58.9 | — | |
| Qwen-VLLLM=Qwen-7B, In-house data=true2024.03 | 58.6 | — | |
| Qwen-VLLanguage=Qwen-7B2024.03 | 58.6 | — | |
| Qwen-VLBackbone=Qwen-7B2023.11 | 58.6 | — | |
| Qwen-VLLLM=7B, Res.=4482024.06 | 58.6 | — | |
| Qwen-VLModel Category=generalist models2023.12 | 58.6 | — | |
| LLaVA-1.5+CoSLanguage=Vicuna-7B2024.03 | 58.4 | — | |
| MM1-30BShot=8, Model Scale=30B2024.03 | 58.3 | — | |
| MM1-30BShot=82024.03 | 58.3 | — | |
| LyricsBackbone=Vicuna-13B2023.12 | 58.2 | — | |
| LLaVA-v1.5LLM=Vicuna-7B2023.12 | 58.2 | — | |
| LaRA2024.06 | 58.1 | — | |
| LLaVA-1.5Language=Vicuna-7B2024.03 | 57.9 | — | |
| ArcanaType=Generalists, LLM=Vicuna (7B), Evaluation Protocol=In-domain, MM-LoRA trained during pretrain=false2024.10 | 57.9 | — | |
| MiniGPT-v2 (7B)-chatGrounding=true2023.10 | 57.8 | — | |
| Flamingo-80BShot=16, Model Scale=80B2024.03 | 57.8 | — | |
| Flamingo-80BShot=162024.03 | 57.8 | — | |
| Flamingo (80B)Shot=162023.12 | 57.8 | — | |
| Flamingo-80Bshots=322024.01 | 57.8 | — | |
| MiniGPT-v2Source=arXiv’232024.07 | 57.8 | — | |
| MiniGPT-v2LLM=7B, Res.=4482024.06 | 57.8 | — | |
| LLaVA2024.06 | 57.8 | — | |
| mPLUG-Owl2LLM=LLaMA2-7B, In-house data=false2024.03 | 57.7 | — | |
| mPLUG-Owl2Language=LLaMA-7B2024.03 | 57.7 | — | |
| mPLUG-Owl2Source=CVPR’242024.07 | 57.7 | — | |
| mPLUG-Owl22023.11 | 57.7 | — | |
| mPLUG-Owl2Type=Generalists, LLM=LLaMA (7B), Evaluation Protocol=In-domain2024.10 | 57.7 | — | |
| UReaderModel Category=generalist models2023.12 | 57.6 | — | |
| Flamingo-80BShot=8, Model Scale=80B2024.03 | 57.5 | — | |
| Flamingo-80BShot=82024.03 | 57.5 | — | |
| Flamingo (80B)Shot=82023.12 | 57.5 | — | |
| Flamingo-80BShot=42024.03 | 57.4 | — | |
| Flamingo (80B)Shot=42023.12 | 57.4 | — | |
| Flamingo-80Bshots=42024.01 | 57.4 | — | |
| LION-12Bparameters=12B2023.11 | 57.33 | — | |
| Emu2-37BShot=16, Model Scale=37B2024.03 | 57.1 | — | |
| Emu2-37BShot=162024.03 | 57.1 | — | |
| Emu2 (37B)Shot=162023.12 | 57.1 | — | |
| DARE-LinearUnsupervised=false2025.03 | 57.06 | -0.14 | |
| INF-LLaVA*Source=Ours, larger_dataset=true2024.07 | 57.04 | — | |
| MiniGPT-v2 (7B)Grounding=false2023.10 | 56.9 | — |