Multi-discipline Reasoning on MMMU
69.1AccuracyGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4oTool Use=false, Param Size=-2026.03 | 69.1 | |
| InternVL3Tool Use=false, Param Size=8B2026.03 | 65.6 | |
| VISEModel Scale=32B2026.06 | 62.79 | |
| VisionZero-CLEVRModel Scale=32B2026.06 | 60.12 | |
| VisionZero-ChartModel Scale=32B2026.06 | 60.04 | |
| EvoLMMModel Scale=32B2026.06 | 59.92 | |
| iReasonerModel Scale=32B2026.06 | 59.85 | |
| BaseModel Scale=32B2026.06 | 59.47 | |
| VisionZero-RWModel Scale=32B2026.06 | 59.33 | |
| VisPlayModel Scale=32B2026.06 | 59.18 | |
| BAGEL (Ours)Baseline=BAGEL, Params=7B active2026.06 | 58.8 | |
| InternVL2.5Tool Use=false, Param Size=8B2026.03 | 56 | |
| VanillaBackbone=InternVL3-8B, Pruning Stage=N/A, Token Retention Rate=100%2026.01 | 55.44 | |
| BAGELBaseline=BAGEL, Params=7B active2026.06 | 55.3 | |
| UniCornBaseline=BAGEL, Params=7B active2026.06 | 53.8 | |
| CAPABackbone=InternVL3-8B, Pruning Stage=Late, Token Retention Rate=25%2026.01 | 53.67 | |
| VisionZero-CLEVRModel Scale=8B2026.06 | 52.89 | |
| BLIP3o-8B (Ours)Baseline=BLIP3o-8B, Params=8B2026.06 | 52.8 | |
| VISEModel Scale=8B2026.06 | 52.69 | |
| VisPlayModel Scale=8B2026.06 | 52.61 | |
| VRETool Use=false, Param Size=7B2026.03 | 52.1 | |
| Semantic-backTool Use=false, Param Size=7B2026.03 | 52 | |
| iReasonerModel Scale=8B2026.06 | 51.83 | |
| VARGPT-v1.1 (Ours)Baseline=VARGPT-v1.1, Params=7B+2B2026.06 | 51.6 | |
| EvoLMMModel Scale=8B2026.06 | 51.56 | |
| Qwen2.5-VLTool Use=false, Param Size=7B2026.03 | 51.2 | |
| BLIP3o-8BBaseline=BLIP3o-8B, Params=8B2026.06 | 50.6 | |
| VisionZero-RWModel Scale=8B2026.06 | 50.43 | |
| BaseModel Scale=8B2026.06 | 50.12 | |
| VisionZero-ChartModel Scale=8B2026.06 | 49.98 | |
| CAPABackbone=Qwen2.5-VL-7B, Pruning Stage=Late, Token Retention Rate=25%2026.01 | 49.33 | |
| VISEModel Scale=4B2026.06 | 48.89 | |
| LLaVA-OneVisionTool Use=false, Param Size=7B2026.03 | 48.8 | |
| VanillaBackbone=Qwen2.5-VL-7B, Pruning Stage=N/A, Token Retention Rate=100%2026.01 | 48.68 | |
| VARGPT-v1.1Baseline=VARGPT-v1.1, Params=7B+2B2026.06 | 48.6 | |
| VisionZero-CLEVRModel Scale=4B2026.06 | 46.27 | |
| VisionZero-ChartModel Scale=4B2026.06 | 46.2 | |
| iReasonerModel Scale=4B2026.06 | 46.13 | |
| EvoLMMModel Scale=4B2026.06 | 46.02 | |
| VisPlayModel Scale=4B2026.06 | 45.42 | |
| VisionZero-RWModel Scale=4B2026.06 | 45.41 | |
| BaseModel Scale=4B2026.06 | 45.17 | |
| UniGameBaseline=Janus-Pro-7B, Params=7B2026.06 | 43.8 | |
| TokenFlowBaseline=TokenFlow2026.06 | 43.2 | |
| MetaMorphBaseline=MetaMorph2026.06 | 41.8 | |
| Janus-Pro-7BBaseline=Janus-Pro-7B, Params=7B2026.06 | 41 | |
| VISEModel Scale=2B2026.06 | 40.67 | |
| VisionZero-CLEVRModel Scale=2B2026.06 | 39.58 | |
| VisionZero-ChartModel Scale=2B2026.06 | 39.5 | |
| VisPlayModel Scale=2B2026.06 | 39.27 | |
| VisionZero-RWModel Scale=2B2026.06 | 39.27 | |
| iReasonerModel Scale=2B2026.06 | 39.11 | |
| EvoLMMModel Scale=2B2026.06 | 39.08 | |
| BaseModel Scale=2B2026.06 | 38.92 | |
| ILLUMEBaseline=Vicuna-7B, Params=7B2026.06 | 38.2 | |
| PRUNESIDRetained Tokens=64, Token Reduction Ratio=↓ 88.9%2026.03 | 37.2 | |
| RubiCap-7B_PixMoCapAnnotator=RubiCap, Model Scale=7B, Caption Generation Strategy=PixMoCap2026.03 | 37 | |
| LLaVA-v1.5-7B + Visual Lazy AttentionBase Model=LLaVA-v1.5-7B, Optimization Method=Visual Lazy Attention2026.02 | 36.8 | |
| VanillaBase Model=LLaVA 1.5 13B, Tokens Retained=576, Projector Fine-tuning=false2024.12 | 36.4 | |
| VisionZipBase Model=LLaVA 1.5 13B, Tokens Retained=192, Projector Fine-tuning=false2024.12 | 36.4 | |
| VisionZip ‡Base Model=LLaVA 1.5 13B, Tokens Retained=192, Projector Fine-tuning=true2024.12 | 36.4 | |
| VisionZipBase Model=LLaVA 1.5 13B, Tokens Retained=64, Projector Fine-tuning=false2024.12 | 36.4 | |
| GPT-4VAnnotator=GPT-4V2026.03 | 36.33 | |
| VanillaRetained Tokens=576, Token Reduction Ratio=100%2026.03 | 36.1 | |
| PRUNESIDRetained Tokens=192, Token Reduction Ratio=↓ 66.7%2026.03 | 36.1 | |
| VisionZipRetained Tokens=192, Token Reduction Ratio=↓ 66.7%2026.03 | 36.1 | |
| LLaVA-NEXT-13B + Visual Lazy AttentionBase Model=LLaVA-NEXT-13B, Optimization Method=Visual Lazy Attention2026.02 | 36.1 | |
| VisionZipBase Model=LLaVA 1.5 13B, Tokens Retained=128, Projector Fine-tuning=false2024.12 | 36.1 | |
| PRUNESIDRetained Tokens=128, Token Reduction Ratio=↓ 77.8%2026.03 | 36 | |
| CAPABackbone=LLaVA-1.5-7B, Pruning Stage=Late, Token Retention Rate=25%2026.01 | 35.89 | |
| RubiCap-3B_DenseFusionAnnotator=RubiCap, Model Scale=3B, Caption Generation Strategy=DenseFusion2026.03 | 35.89 | |
| VisionZipRetained Tokens=64, Token Reduction Ratio=↓ 88.9%2026.03 | 35.6 | |
| SEED-XBaseline=SEED-X2026.06 | 35.6 | |
| VisionZip ‡Base Model=LLaVA 1.5 13B, Tokens Retained=128, Projector Fine-tuning=true2024.12 | 35.4 | |
| LLaVA-v1.5-7BBase Model=LLaVA-v1.5-7B, Optimization Method=None2026.02 | 35.3 | |
| VisionZip ‡Base Model=LLaVA 1.5 13B, Tokens Retained=64, Projector Fine-tuning=true2024.12 | 35.3 | |
| RubiCap-3B_PixMoCapAnnotator=RubiCap, Model Scale=3B, Caption Generation Strategy=PixMoCap2026.03 | 35.22 | |
| VisionZipRetained Tokens=128, Token Reduction Ratio=↓ 77.8%2026.03 | 34.8 | |
| VanillaBackbone=LLaVA-1.5-7B, Pruning Stage=N/A, Token Retention Rate=100%2026.01 | 34.67 | |
| Emu3Baseline=Emu32026.06 | 31.6 | |
| JanusBaseline=Janus2026.06 | 30.5 | |
| Show-oBaseline=Show-o2026.06 | 27.4 | |
| ChameleonBaseline=Chameleon2026.06 | 22.4 |