Accuracy on Multimodal Understanding on MMBench
90.1AccuracyGemini-2.5-Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-2.5-ProSize=-2026.06 | 90.1 | |
| BF16Model=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=BF162026.06 | 86.86 | |
| VanillaBackbone=Qwen3-VL-8B, TFLOPs=100%2026.06 | 84.79 | |
| VanillaBackbone=InternVL-2.5-8B, Token Reduction Ratio=0%2026.06 | 84.7 | |
| SPOT-EBase Model=Qwen3-VL-8B, Source Type=Open-Source, Test-time Adaptation=SPOT-E2026.06 | 84.6 | |
| CoLTSize=8B, Backbone=Qwen3-VL-8B2026.06 | 84.6 | |
| VanillaAverage Token Reduction=0.0%, Backbone=Qwen3-VL-8B2026.06 | 84.4 | |
| CLSE localBackbone=InternVL-2.5-8B, Token Reduction Ratio=66.7%, FFT Type=Local2026.06 | 84.1 | |
| LLaVA-OneVision-1.5Size=8B2026.06 | 84.1 | |
| SPOT-EBase Model=GPT-4o, Source Type=Closed-Source, Test-time Adaptation=SPOT-E2026.06 | 83.9 | |
| Qwen3-VL-8BBase Model=Qwen3-VL-8B, Source Type=Open-Source, Test-time Adaptation=None2026.06 | 83.8 | |
| FastVBackbone=InternVL-2.5-8B, Token Reduction Ratio=66.7%2026.06 | 83.8 | |
| GPT-5-highSize=-2026.06 | 83.8 | |
| CLSE globalBackbone=InternVL-2.5-8B, Token Reduction Ratio=66.7%, FFT Type=Global2026.06 | 83.7 | |
| CLSE localBackbone=InternVL-2.5-8B, Token Reduction Ratio=77.8%, FFT Type=Local2026.06 | 83.6 | |
| SPOT-EBase Model=Qwen2.5-VL-7B, Source Type=Open-Source, Test-time Adaptation=SPOT-E2026.06 | 83.5 | |
| CLSE globalBackbone=InternVL-2.5-8B, Token Reduction Ratio=77.8%, FFT Type=Global2026.06 | 83.5 | |
| InternVL3Size=8B2026.06 | 83.4 | |
| Qwen3-VL (Textual reasoning)Size=8B2026.06 | 83.4 | |
| VanillaBackbone=Qwen2.5-VL-7B, TFLOPs=100%2026.06 | 83.25 | |
| GPT-4oBase Model=GPT-4o, Source Type=Closed-Source, Test-time Adaptation=None2026.06 | 83.1 | |
| Op-SkipBackbone=Qwen3-VL-8B, TFLOPs=66%, N=202026.06 | 83.08 | |
| Claude-Opus-4.1Size=-2026.06 | 83 | |
| BF16Model=Kimi-VL-A3B-Instruct, Avg-Bit=BF162026.06 | 82.99 | |
| SPOT-EBase Model=Gemini-2.5-Flash, Source Type=Closed-Source, Test-time Adaptation=SPOT-E2026.06 | 82.8 | |
| Qwen2.5-VL-7BBase Model=Qwen2.5-VL-7B, Source Type=Open-Source, Test-time Adaptation=None2026.06 | 82.6 | |
| MODEModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W32026.06 | 82.56 | |
| V2DropBackbone=Qwen3-VL-8B, TFLOPs=66%2026.06 | 82.56 | |
| SPOT-EBase Model=InternVL3-8B, Source Type=Open-Source, Test-time Adaptation=SPOT-E2026.06 | 82.5 | |
| APETBackbone=Qwen3-VL-8B, TFLOPs=66%2026.06 | 82.47 | |
| Gemini-2.5-FlashBase Model=Gemini-2.5-Flash, Source Type=Closed-Source, Test-time Adaptation=None2026.06 | 82 | |
| SIM-CoTSize=8B, Backbone=Qwen3-VL-8B2026.06 | 82 | |
| VSkipBackbone=Qwen3-VL-8B, TFLOPs=76%, N=202026.06 | 81.87 | |
| InternVL3-8BBase Model=InternVL3-8B, Source Type=Open-Source, Test-time Adaptation=None2026.06 | 81.7 | |
| CLSE globalBackbone=InternVL-2.5-8B, Token Reduction Ratio=88.9%, FFT Type=Global2026.06 | 81.7 | |
| APETBackbone=Qwen2.5-VL-7B, TFLOPs=55%2026.06 | 81.7 | |
| ShortVBackbone=Qwen3-VL-8B, TFLOPs=58%, N=202026.06 | 81.62 | |
| SPOT-EBase Model=InternVL2.5-8B, Source Type=Open-Source, Test-time Adaptation=SPOT-E2026.06 | 81.5 | |
| LVRSize=7B2026.06 | 81.5 | |
| CLSE localBackbone=InternVL-2.5-8B, Token Reduction Ratio=88.9%, FFT Type=Local2026.06 | 81.4 | |
| FastVBackbone=InternVL-2.5-8B, Token Reduction Ratio=77.8%2026.06 | 81.1 | |
| SoftCoTSize=8B, Backbone=Qwen3-VL-8B2026.06 | 81 | |
| MODEModel=Kimi-VL-A3B-Instruct, Avg-Bit=W32026.06 | 80.84 | |
| Op-SkipBackbone=Qwen2.5-VL-7B, TFLOPs=55%, N=202026.06 | 80.67 | |
| InternVL2.5-8BBase Model=InternVL2.5-8B, Source Type=Open-Source, Test-time Adaptation=None2026.06 | 80.5 | |
| V2DropBackbone=Qwen2.5-VL-7B, TFLOPs=55%2026.06 | 80.29 | |
| CODISize=8B, Backbone=Qwen3-VL-8B2026.06 | 80.2 | |
| VEQ-MEModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W32026.06 | 80.15 | |
| VSkipBackbone=Qwen2.5-VL-7B, TFLOPs=67%, N=162026.06 | 80.15 | |
| MC-MoEModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W32026.06 | 80.01 | |
| Multimodal CoTSize=8B, Backbone=Qwen3-VL-8B2026.06 | 79.5 | |
| SPOT-EBase Model=GPT-4o-mini, Source Type=Closed-Source, Test-time Adaptation=SPOT-E2026.06 | 79.2 | |
| ICoTSize=8B, Backbone=Qwen3-VL-8B2026.06 | 79.1 | |
| Speed-QModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W32026.06 | 78.65 | |
| CCoTSize=8B, Backbone=Qwen3-VL-8B2026.06 | 78.4 | |
| MoEQuantModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W32026.06 | 78.21 | |
| MC-MoEModel=Kimi-VL-A3B-Instruct, Avg-Bit=W32026.06 | 78.13 | |
| GPT-4o-miniBase Model=GPT-4o-mini, Source Type=Closed-Source, Test-time Adaptation=None2026.06 | 78 | |
| VEQ-MEModel=Kimi-VL-A3B-Instruct, Avg-Bit=W32026.06 | 77.84 | |
| SPOT-EBase Model=LLaVA-OV-7B, Source Type=Open-Source, Test-time Adaptation=SPOT-E2026.06 | 77.4 | |
| MBQModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W32026.06 | 77.24 | |
| GPTQModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W32026.06 | 76.63 | |
| FastVAverage Token Reduction=66.7%, Backbone=Qwen3-VL-8B2026.06 | 76.6 | |
| Speed-QModel=Kimi-VL-A3B-Instruct, Avg-Bit=W32026.06 | 76.55 | |
| SPOT-EBase Model=LLaVA-NeXT-7B, Source Type=Open-Source, Test-time Adaptation=SPOT-E2026.06 | 76.5 | |
| MoEQuantModel=Kimi-VL-A3B-Instruct, Avg-Bit=W32026.06 | 76.39 | |
| MBQModel=Kimi-VL-A3B-Instruct, Avg-Bit=W32026.06 | 76.21 | |
| Qwen3-VL (Direct answer)Size=8B2026.06 | 76.2 | |
| LLaVA-OV-7BBase Model=LLaVA-OV-7B, Source Type=Open-Source, Test-time Adaptation=None2026.06 | 76 | |
| PDrop+RerouteAverage Token Reduction=66.7%, Backbone=Qwen3-VL-8B2026.06 | 75.8 | |
| MODEModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W22026.06 | 75.71 | |
| Janus Pro#Params=1.5B, TFLOPs=0.82025.06 | 75.5 | |
| PDropAverage Token Reduction=66.7%, Backbone=Qwen3-VL-8B2026.06 | 75.4 | |
| MODEModel=Kimi-VL-A3B-Instruct, Avg-Bit=W22026.06 | 75.23 | |
| MetaMorph#Params=8B, TFLOPs=1.12025.06 | 75.2 | |
| GPTQModel=Kimi-VL-A3B-Instruct, Avg-Bit=W32026.06 | 75.04 | |
| LLaVA-NeXT-7BBase Model=LLaVA-NeXT-7B, Source Type=Open-Source, Test-time Adaptation=None2026.06 | 75 | |
| Qwen2-VL-2B#Params=2B, TFLOPs=0.42025.06 | 74.9 | |
| LaTtE-Flow#Params=2B, TFLOPs=0.42025.06 | 74.9 | |
| FastVBackbone=InternVL-2.5-8B, Token Reduction Ratio=88.9%2026.06 | 73.9 | |
| MC-MoEModel=Kimi-VL-A3B-Instruct, Avg-Bit=W22026.06 | 72.61 | |
| ShortVBackbone=Qwen2.5-VL-7B, TFLOPs=50%, N=202026.06 | 72.25 | |
| VEQ-MEModel=Kimi-VL-A3B-Instruct, Avg-Bit=W22026.06 | 72.16 | |
| VEQ-MEModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W22026.06 | 71.68 | |
| FastV+RerouteAverage Token Reduction=66.7%, Backbone=Qwen3-VL-8B2026.06 | 71.3 | |
| PDrop+RerouteAverage Token Reduction=77.8%, Backbone=Qwen3-VL-8B2026.06 | 70.3 | |
| Seed-X#Params=17B, TFLOPs=11.12025.06 | 70.1 | |
| Janus#Params=1.5B, TFLOPs=0.82025.06 | 69.4 | |
| VTWBackbone=Qwen2.5-VL-7B, TFLOPs=50%, K=162026.06 | 68.21 | |
| FastVAverage Token Reduction=77.8%, Backbone=Qwen3-VL-8B2026.06 | 68 | |
| PDropAverage Token Reduction=77.8%, Backbone=Qwen3-VL-8B2026.06 | 67.9 | |
| VTWBackbone=Qwen3-VL-8B, TFLOPs=58%, K=162026.06 | 67.53 | |
| MC-MoEModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W22026.06 | 66.74 | |
| VILA-U#Params=7B, TFLOPs=3.62025.06 | 66.6 | |
| VSkipBackbone=LLaVA-1.5-7B, TFLOPs=76%, N=202026.06 | 64.69 | |
| VanillaToken Budget (K)=576, Token Reduction (%)=100%, Model Backbone=LLaVA-1.5-7B2026.06 | 64.6 | |
| ShortVBackbone=LLaVA-1.5-7B, TFLOPs=55%, N=202026.06 | 64.6 | |
| VSkip+Backbone=LLaVA-1.5-7B, TFLOPs=76%, N=202026.06 | 64.6 | |
| Op-SkipBackbone=LLaVA-1.5-7B, TFLOPs=66%, N=202026.06 | 64.52 | |
| MoEQuantModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W22026.06 | 64.49 |