Real-world Visual Understanding on RealWorldQA
81.4AccuracyInternVL2.5-8B-GenRecal
Evaluation Results
| Method | Links | |
|---|---|---|
| InternVL2.5-8B-GenRecalTeacher VLM=InternVL2.5-78B2025.06 | 81.4 | |
| Qwen2.5-VL-72B + CARESCost=-82%2025.10 | 79 | |
| InternVL2.5-8B-GenRecalTeacher VLM=Qwen2-VL-72B2025.06 | 78.8 | |
| InternVL2.5-78B2025.06 | 78.7 | |
| Qwen2-VL-72B2025.06 | 77.8 | |
| Qwen2.5-VL-72B2025.10 | 77 | |
| SkillGraphModel=Qwen3-VL 8B-Instruct, Baseline=Complete2026.04 | 76.4 | |
| SkillGraphModel=Qwen3-VL 8B-Instruct, Baseline=Random2026.04 | 76.1 | |
| InternVL2.5-8B-GenRecalTeacher VLM=InternVL2-76B2025.06 | 75.5 | |
| GPT-4o (0513)2025.06 | 75.4 | |
| SkillGraphModel=Qwen3-VL 8B-Instruct, Baseline=Layered2026.04 | 75.4 | |
| RandomModel=Qwen3-VL 8B-Instruct2026.04 | 75.3 | |
| CompleteModel=Qwen3-VL 8B-Instruct2026.04 | 75.2 | |
| SkillGraphModel=Qwen3-VL 8B-Instruct, Baseline=Centralized2026.04 | 74.9 | |
| SkillGraphModel=InternVL3-8B, Baseline=Complete2026.04 | 74.7 | |
| SkillGraphModel=Qwen3-VL 8B-Instruct, Baseline=Linear2026.04 | 74.4 | |
| SkillGraphModel=InternVL3-8B, Baseline=Random2026.04 | 74.1 | |
| LayeredModel=Qwen3-VL 8B-Instruct2026.04 | 73.9 | |
| Vanilla MoEBackbone=QWEN3-VL-30B-A3B-INSTRUCT2026.04 | 73.72 | |
| Molmo-72B2025.06 | 73.7 | |
| SkillGraphModel=InternVL3-8B, Baseline=Layered2026.04 | 73.7 | |
| MACS (Ours)Backbone=QWEN3-VL-30B-A3B-INSTRUCT2026.04 | 73.58 | |
| LinearModel=Qwen3-VL 8B-Instruct2026.04 | 73.4 | |
| SkillGraphModel=InternVL3-8B, Baseline=Linear2026.04 | 73.4 | |
| SkillGraphModel=InternVL3-8B, Baseline=Centralized2026.04 | 73.4 | |
| CentralizedModel=Qwen3-VL 8B-Instruct2026.04 | 73.2 | |
| MACS (w/o Expanded)Backbone=QWEN3-VL-30B-A3B-INSTRUCT2026.04 | 73.15 | |
| RandomModel=InternVL3-8B2026.04 | 73.1 | |
| CompleteModel=InternVL3-8B2026.04 | 72.9 | |
| InternVL2.5-8B-GenRecalTeacher VLM=NVLM-72B2025.06 | 72.5 | |
| InternVL2-76B2025.06 | 72.2 | |
| SkillGraphModel=Qwen2.5-VL 7B-Instruct, Baseline=Random2026.04 | 72.2 | |
| LayeredModel=InternVL3-8B2026.04 | 72.2 | |
| LLaVA-OneVision-72B2025.06 | 71.9 | |
| SkillGraphModel=Qwen2.5-VL 7B-Instruct, Baseline=Complete2026.04 | 71.9 | |
| LinearModel=InternVL3-8B2026.04 | 71.6 | |
| CentralizedModel=InternVL3-8B2026.04 | 71.5 | |
| DirectAnswerModel=Qwen3-VL 8B-Instruct2026.04 | 71.4 | |
| Qwen3-VL-SegModel Size=4B, Training Stage=S-22026.05 | 71.2 | |
| SkillGraphModel=Qwen2.5-VL 7B-Instruct, Baseline=Layered2026.04 | 71.1 | |
| SkillGraphModel=Qwen2.5-VL 7B-Instruct, Baseline=Centralized2026.04 | 70.9 | |
| Qwen3-VLModel Size=4B, Training Stage=instruct2026.05 | 70.9 | |
| DirectAnswerModel=InternVL3-8B2026.04 | 70.7 | |
| SkillGraphModel=Qwen2.5-VL 7B-Instruct, Baseline=Linear2026.04 | 70.6 | |
| SkillGraphModel=LLaVA-OV Qwen2-7B, Baseline=Complete2026.04 | 70.5 | |
| RandomModel=Qwen2.5-VL 7B-Instruct2026.04 | 70.4 | |
| SkillGraphModel=LLaVA-OV Qwen2-7B, Baseline=Random2026.04 | 70.3 | |
| CompleteModel=Qwen2.5-VL 7B-Instruct2026.04 | 70.3 | |
| SkillGraphModel=LLaVA-OV Qwen2-7B, Baseline=Layered2026.04 | 70.1 | |
| NVLM-72B2025.06 | 69.9 | |
| SkillGraphModel=LLaVA-OV Qwen2-7B, Baseline=Centralized2026.04 | 69.8 | |
| LayeredModel=Qwen2.5-VL 7B-Instruct2026.04 | 69.7 | |
| SkillGraphModel=LLaVA-OV Qwen2-7B, Baseline=Linear2026.04 | 69.6 | |
| CAI-MoE (Expanded)Backbone=QWEN3-VL-30B-A3B-INSTRUCT2026.04 | 69.46 | |
| RandomModel=LLaVA-OV Qwen2-7B2026.04 | 69.4 | |
| LinearModel=Qwen2.5-VL 7B-Instruct2026.04 | 69.3 | |
| CompleteModel=LLaVA-OV Qwen2-7B2026.04 | 69.2 | |
| CentralizedModel=Qwen2.5-VL 7B-Instruct2026.04 | 69.2 | |
| DirectAnswerModel=Qwen2.5-VL 7B-Instruct2026.04 | 68.6 | |
| LayeredModel=LLaVA-OV Qwen2-7B2026.04 | 68.5 | |
| LinearModel=LLaVA-OV Qwen2-7B2026.04 | 68.1 | |
| Vanilla MoEBackbone=KIMI-VL-A3B-INSTRUCT2026.04 | 68.07 | |
| InternVL3-8B2025.10 | 68 | |
| InternVL3-8B + CARESCost=-82%2025.10 | 68 | |
| InternVL3-8B + CARES-ARCost=-82%2025.10 | 68 | |
| Qwen3-VLModel Size=4B, Training Stage=S-12026.05 | 68 | |
| MACS (Ours)Backbone=KIMI-VL-A3B-INSTRUCT2026.04 | 67.96 | |
| CentralizedModel=LLaVA-OV Qwen2-7B2026.04 | 67.9 | |
| CAI-MoE (Token Drop)Backbone=QWEN3-VL-30B-A3B-INSTRUCT2026.04 | 67.89 | |
| MACS (w/o Expanded)Backbone=KIMI-VL-A3B-INSTRUCT2026.04 | 67.63 | |
| Gemini-1.5-Pro2025.06 | 67.5 | |
| DirectAnswerModel=LLaVA-OV Qwen2-7B2026.04 | 67.2 | |
| InternVL-3.5Model Size=4B2026.05 | 66.3 | |
| InternVL2-8BModel=InternVL2-8B, Pruning Method=None2025.09 | 65.5 | |
| PTPModel=InternVL2-8B, Pruning Method=PTP, Pruning Ratio (r)=0.5, Balancing Weight (alpha)=0.52025.09 | 65.3 | |
| CAI-MoE (Expanded)Backbone=KIMI-VL-A3B-INSTRUCT2026.04 | 65.18 | |
| Vanilla MoEBackbone=INTERNVL3.5-30B-A3B2026.04 | 64.87 | |
| Top-k RoutingExpert skipping ratio (ρ)=0, Number of experts (k)=8, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 64.77 | |
| MACS (Ours)Backbone=INTERNVL3.5-30B-A3B2026.04 | 64.69 | |
| MACS (w/o Expanded)Backbone=INTERNVL3.5-30B-A3B2026.04 | 64.12 | |
| CAI-MoE (Token Drop)Backbone=KIMI-VL-A3B-INSTRUCT2026.04 | 63.42 | |
| MoDESExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 63.1 | |
| DiEPExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 62.56 | |
| Gemma3-27BModel Size=27B2025.12 | 62.5 | |
| MoDESExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 62.48 | |
| MC-MoEExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 62.13 | |
| MoDESExpert skipping ratio (ρ)=0.85, Number of experts (k)=1, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 61.73 | |
| NAEEExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 61.47 | |
| Gemma3-4B + AuditDMModel Size=4B, Auditing Component=AuditDM2025.12 | 61.4 | |
| Top-k RoutingExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 61.34 | |
| CAI-MoE (Expanded)Backbone=INTERNVL3.5-30B-A3B2026.04 | 61.05 | |
| GPT-4o2025.10 | 61 | |
| GPT-4o + CARESCost=-84%2025.10 | 61 | |
| MC-MoEExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 60.28 | |
| Claude-3.5-Sonnet2025.06 | 60.1 | |
| NAEEExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 59.47 | |
| DiEPExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 58.74 | |
| CAI-MoE (Token Drop)Backbone=INTERNVL3.5-30B-A3B2026.04 | 58.34 | |
| Gemma3-12BModel Size=12B2025.12 | 58.3 | |
| PTPModel=InternVL2-2B, Pruning Method=PTP, Pruning Ratio (r)=0.5, Balancing Weight (alpha)=0.52025.09 | 57.5 |