Visual Question Answering on MMMU
81.7AccuracyGemini 2.5 Pro
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gemini 2.5 Pro2026.04 | 81.7 | — | |
| Qwen3-VL-32B-Instruct + SpatialBoostEncoder Enhancement=SpatialBoost2026.03 | 76.4 | — | |
| Qwen3-VL-32B-Instruct2026.03 | 76 | — | |
| OpenVLThinkerV2Parameters=8B2026.04 | 71.6 | — | |
| InternVL3-38B + SpatialBoostEncoder Enhancement=SpatialBoost2026.03 | 70.8 | — | |
| GPT-4o2026.04 | 70.7 | — | |
| OneThinker-8BParameters=8B2026.04 | 70.6 | — | |
| InternVL3-38B2026.03 | 70.1 | — | |
| Qwen3-VL GDPORL Strategy=GDPO2026.04 | 69.8 | — | |
| Qwen3-VL GRPORL Strategy=GRPO2026.04 | 69.7 | — | |
| ARES-7BParameters=7B2026.04 | 67.9 | — | |
| GDRMModel=Qwen3-VL-Thinking (4B), Decoding Strategy=Beam Search, Decoding Framework=GDRM2026.04 | 60.92 | — | |
| Qwen3-VL-Instruct-8BParameters=8B2026.04 | 60.2 | — | |
| Beam SearchModel=Qwen3-VL-Thinking (4B), Decoding Strategy=Beam Search, Decoding Framework=Baseline2026.04 | 59.78 | — | |
| VisionZero2026.04 | 58.8 | — | |
| MM-Eureka-7BParameters=7B2026.04 | 57.3 | — | |
| VL-Rethinker-7BParameters=7B2026.04 | 56.7 | — | |
| OpenVLThinker-7BParameters=7B2026.04 | 55.8 | — | |
| GDRMModel=Qwen3-VL-Thinking (4B), Decoding Strategy=Min-p, Decoding Framework=GDRM2026.04 | 55.33 | — | |
| GDRMModel=Qwen3-VL-Thinking (4B), Decoding Strategy=Top-k, Decoding Framework=GDRM2026.04 | 54.78 | — | |
| GDRMModel=Qwen3-VL-Thinking (4B), Decoding Strategy=ε-Sampling, Decoding Framework=GDRM2026.04 | 54.78 | — | |
| GDRMModel=Qwen3-VL-Thinking (4B), Decoding Strategy=Top-p (nucleus), Decoding Framework=GDRM2026.04 | 54.67 | — | |
| Top-p (nucleus)Model=Qwen3-VL-Thinking (4B), Decoding Strategy=Top-p (nucleus), Decoding Framework=Baseline2026.04 | 54.56 | — | |
| GDRMModel=Qwen3-VL-Thinking (4B), Decoding Strategy=Temp’ Only, Decoding Framework=GDRM2026.04 | 54.44 | — | |
| ε-SamplingModel=Qwen3-VL-Thinking (4B), Decoding Strategy=ε-Sampling, Decoding Framework=Baseline2026.04 | 54.22 | — | |
| GDRMModel=Qwen3-VL-Thinking (4B), Decoding Strategy=η-Sampling, Decoding Framework=GDRM2026.04 | 54.22 | — | |
| Top-kModel=Qwen3-VL-Thinking (4B), Decoding Strategy=Top-k, Decoding Framework=Baseline2026.04 | 54.11 | — | |
| GreedyModel=Qwen3-VL-Thinking (4B), Decoding Strategy=Greedy, Decoding Framework=Baseline2026.04 | 54.11 | — | |
| Min-pModel=Qwen3-VL-Thinking (4B), Decoding Strategy=Min-p, Decoding Framework=Baseline2026.04 | 53.78 | — | |
| Vision-G12026.04 | 53.4 | — | |
| Temp’ OnlyModel=Qwen3-VL-Thinking (4B), Decoding Strategy=Temp’ Only, Decoding Framework=Baseline2026.04 | 53.22 | — | |
| η-SamplingModel=Qwen3-VL-Thinking (4B), Decoding Strategy=η-Sampling, Decoding Framework=Baseline2026.04 | 51.89 | — | |
| FastVSource=ECCV’24, Token Reduction=66.7%, Backbone=Qwen2.5-VL-7B2026.06 | 49.6 | — | |
| VanillaSource=Qwen’25, Token Reduction=0%, Backbone=Qwen2.5-VL-7B2026.06 | 48.7 | — | |
| PDropSource=CVPR’25, Token Reduction=66.7%, Backbone=Qwen2.5-VL-7B2026.06 | 48.4 | — | |
| VanillaSource=Qwen’25, Backbone=Qwen3.5-9B-Hybrid, Average Gated Attention Token Reduction=0%2026.06 | 48.1 | — | |
| PDrop+RerouteSource=Ours, Backbone=Qwen3.5-9B-Hybrid, Average Gated Attention Token Reduction=66.7%2026.06 | 48.1 | — | |
| FastV+RerouteSource=Ours, Token Reduction=66.7%, Backbone=Qwen2.5-VL-7B2026.06 | 47.3 | — | |
| PDropSource=CVPR’25, Token Reduction=77.8%, Backbone=Qwen2.5-VL-7B2026.06 | 47 | — | |
| PDrop+RerouteSource=Ours, Token Reduction=66.7%, Backbone=Qwen2.5-VL-7B2026.06 | 46.7 | — | |
| PDrop+RerouteSource=Ours, Token Reduction=77.8%, Backbone=Qwen2.5-VL-7B2026.06 | 45.8 | — | |
| PDropSource=CVPR’25, Token Reduction=88.9%, Backbone=Qwen2.5-VL-7B2026.06 | 45.4 | — | |
| FastVSource=ECCV’24, Backbone=Qwen3.5-9B-Hybrid, Average Gated Attention Token Reduction=66.7%2026.06 | 45.3 | — | |
| PDrop+RerouteSource=Ours, Backbone=Qwen3.5-9B-Hybrid, Average Gated Attention Token Reduction=88.9%2026.06 | 45.1 | — | |
| FastV+RerouteSource=Ours, Token Reduction=77.8%, Backbone=Qwen2.5-VL-7B2026.06 | 45 | — | |
| FastV+RerouteSource=Ours, Backbone=Qwen3.5-9B-Hybrid, Average Gated Attention Token Reduction=77.8%2026.06 | 45 | — | |
| FastVSource=ECCV’24, Token Reduction=77.8%, Backbone=Qwen2.5-VL-7B2026.06 | 44.9 | — | |
| PDrop+RerouteSource=Ours, Backbone=Qwen3.5-9B-Hybrid, Average Gated Attention Token Reduction=77.8%2026.06 | 44.6 | — | |
| PDrop+RerouteSource=Ours, Token Reduction=88.9%, Backbone=Qwen2.5-VL-7B2026.06 | 44.4 | — | |
| PDropSource=CVPR’25, Backbone=Qwen3.5-9B-Hybrid, Average Gated Attention Token Reduction=66.7%2026.06 | 44.3 | — | |
| FastV+RerouteSource=Ours, Backbone=Qwen3.5-9B-Hybrid, Average Gated Attention Token Reduction=66.7%2026.06 | 44.3 | — | |
| PDropSource=CVPR’25, Backbone=Qwen3.5-9B-Hybrid, Average Gated Attention Token Reduction=77.8%2026.06 | 44.3 | — | |
| FastVSource=ECCV’24, Backbone=Qwen3.5-9B-Hybrid, Average Gated Attention Token Reduction=88.9%2026.06 | 43.3 | — | |
| FastVSource=ECCV’24, Backbone=Qwen3.5-9B-Hybrid, Average Gated Attention Token Reduction=77.8%2026.06 | 43.2 | — | |
| FastV+RerouteSource=Ours, Backbone=Qwen3.5-9B-Hybrid, Average Gated Attention Token Reduction=88.9%2026.06 | 42.8 | — | |
| PDropSource=CVPR’25, Backbone=Qwen3.5-9B-Hybrid, Average Gated Attention Token Reduction=88.9%2026.06 | 42.3 | — | |
| FastV+RerouteSource=Ours, Token Reduction=88.9%, Backbone=Qwen2.5-VL-7B2026.06 | 41.7 | — | |
| FastVSource=ECCV’24, Token Reduction=88.9%, Backbone=Qwen2.5-VL-7B2026.06 | 41.2 | — | |
| VisionZipSource=CVPR’25, Average Token=128, Reroute=false2026.06 | 37.9 | 96.9 | |
| FastVModel=LLaVA1.5-13B, k=5, e=50%, Cache Memory Reduction=1×, Average Throughput Change=+20%2026.03 | 36.61 | — | |
| VisionZipSource=CVPR’25, Average Token=192, Reroute=false2026.06 | 36.6 | 97.9 | |
| Full KV CachingModel=LLaVA1.5-13B2026.03 | 36.4 | — | |
| NüwaSource=ICLR’26, Average Token=64, Reroute=false2026.06 | 36.4 | 95.8 | |
| AttentionPackModel=LLaVA1.5-13B, Rkv=64, Rvv=64, Cache Memory Reduction=5.17×, Average Throughput Change=+43%2026.03 | 36.38 | — | |
| VanillaSource=CVPR’24, Average Token=576, Reroute=false2026.06 | 36.3 | 100 | |
| PruMergeSource=ICCV’25, Average Token=128, Reroute=false2026.06 | 36.2 | 94.7 | |
| VisionZipSource=CVPR’25, Average Token=64, Reroute=false2026.06 | 36.2 | 93.2 | |
| Nüwa+RerouteSource=Ours, Average Token=128, Reroute=true2026.06 | 36.1 | 99.8 | |
| Nüwa+RerouteSource=Ours, Average Token=64, Reroute=true2026.06 | 35.9 | 96.7 | |
| Full KV CachingModel=QwenVL-Chat-7B2026.03 | 35.82 | — | |
| FastVModel=QwenVL-Chat-7B, k=2, e=50%, Cache Memory Reduction=1×, Average Throughput Change=+45%2026.03 | 35.8 | — | |
| NüwaSource=ICLR’26, Average Token=128, Reroute=false2026.06 | 35.8 | 98.4 | |
| PruMergeSource=ICCV’25, Average Token=64, Reroute=false2026.06 | 35.8 | 92.1 | |
| AttentionPackModel=QwenVL-Chat-7B, Rkv=64, Rvv=64, Cache Memory Reduction=2.77×, Average Throughput Change=+61%2026.03 | 35.72 | — | |
| Nüwa+RerouteSource=Ours, Average Token=192, Reroute=true2026.06 | 35.7 | 100.6 | |
| AttentionPackModel=QwenVL-Chat-7B, Rkv=32, Rvv=32, Cache Memory Reduction=4.02×, Average Throughput Change=+74%2026.03 | 35.67 | — | |
| MinicacheModel=LLaVA1.5-13B, Cache Memory Reduction=4.35×, Average Throughput Change=+38%2026.03 | 35.52 | — | |
| NüwaSource=ICLR’26, Average Token=192, Reroute=false2026.06 | 35.5 | 99.2 | |
| SparseVLMSource=ICML’25, Average Token=64, Reroute=false2026.06 | 35.4 | 91.5 | |
| ScissorHandsModel=QwenVL-Chat-7B, e=50%, Cache Memory Reduction=2×, Average Throughput Change=+51%2026.03 | 35.14 | — | |
| H2OModel=QwenVL-Chat-7B, e=50%, Cache Memory Reduction=2×, Average Throughput Change=+51%2026.03 | 35.05 | — | |
| FastVSource=ECCV’24, Average Token=128, Reroute=false2026.06 | 34.9 | 85.2 | |
| Full KV CachingModel=LLaVA1.5-7B2026.03 | 34.68 | — | |
| AttentionPackModel=LLaVA1.5-7B, Rkv=64, Rvv=64, Cache Memory Reduction=5.09×, Average Throughput Change=+54%2026.03 | 34.59 | — | |
| AttentionPackModel=LLaVA1.5-13B, Rkv=32, Rvv=32, Cache Memory Reduction=7.30×, Average Throughput Change=+50%2026.03 | 34.4 | — | |
| FastVSource=ECCV’24, Average Token=192, Reroute=false2026.06 | 34.3 | 90.1 | |
| FastVModel=LLaVA1.5-7B, k=5, e=50%, Cache Memory Reduction=1×, Average Throughput Change=+29%2026.03 | 34.27 | — | |
| PDropSource=CVPR’25, Average Token=128, Reroute=false2026.06 | 34.2 | 93.8 | |
| PDropSource=CVPR’25, Average Token=192, Reroute=false2026.06 | 34.1 | 95.7 | |
| FastVSource=ECCV’24, Average Token=64, Reroute=false2026.06 | 34 | 77.9 | |
| SparseVLMSource=ICML’25, Average Token=192, Reroute=false2026.06 | 33.8 | 95.4 | |
| SparseVLMSource=ICML’25, Average Token=128, Reroute=false2026.06 | 33.8 | 92.9 | |
| MinicacheModel=LLaVA1.5-7B, Cache Memory Reduction=4.51×, Average Throughput Change=+44%2026.03 | 33.75 | — | |
| H2OModel=LLaVA1.5-13B, e=50%, Cache Memory Reduction=2×, Average Throughput Change=+24%2026.03 | 33.01 | — | |
| AttentionPackModel=LLaVA1.5-7B, Rkv=32, Rvv=32, Cache Memory Reduction=7.24×, Average Throughput Change=+65%2026.03 | 32.79 | — | |
| H2OModel=LLaVA1.5-7B, e=50%, Cache Memory Reduction=2×, Average Throughput Change=+32%2026.03 | 32.15 | — | |
| ScissorHandsModel=LLaVA1.5-13B, e=50%, Cache Memory Reduction=2×, Average Throughput Change=+24%2026.03 | 31.9 | — | |
| ScissorHandsModel=LLaVA1.5-7B, e=50%, Cache Memory Reduction=2×, Average Throughput Change=+32%2026.03 | 31.66 | — | |
| PDropSource=CVPR’25, Average Token=64, Reroute=false2026.06 | 26.5 | 70.3 | |
| OpenCLIP + Qwen2.5-3BVision Encoder=OpenCLIP, LLM=Qwen2.5-3B2026.05 | 24.4 | — |