Multi-modal Understanding on MMVet (Accuracy)
85.67AccuracyVanilla MoE
Evaluation Results
| Method | Links | |
|---|---|---|
| Vanilla MoEBackbone=QWEN3-VL-30B-A3B-INSTRUCT2026.04 | 85.67 | |
| MACS (Ours)Backbone=QWEN3-VL-30B-A3B-INSTRUCT2026.04 | 85.48 | |
| Vanilla MoEBackbone=INTERNVL3.5-30B-A3B2026.04 | 85.43 | |
| MACS (Ours)Backbone=INTERNVL3.5-30B-A3B2026.04 | 85.17 | |
| MACS (w/o Expanded)Backbone=QWEN3-VL-30B-A3B-INSTRUCT2026.04 | 85.03 | |
| MACS (w/o Expanded)Backbone=INTERNVL3.5-30B-A3B2026.04 | 84.66 | |
| CAI-MoE (Expanded)Backbone=QWEN3-VL-30B-A3B-INSTRUCT2026.04 | 81.63 | |
| CAI-MoE (Expanded)Backbone=INTERNVL3.5-30B-A3B2026.04 | 80.14 | |
| CAI-MoE (Token Drop)Backbone=QWEN3-VL-30B-A3B-INSTRUCT2026.04 | 79.21 | |
| Vanilla MoEBackbone=KIMI-VL-A3B-INSTRUCT2026.04 | 77.84 | |
| MACS (Ours)Backbone=KIMI-VL-A3B-INSTRUCT2026.04 | 77.63 | |
| CAI-MoE (Token Drop)Backbone=INTERNVL3.5-30B-A3B2026.04 | 77.19 | |
| MACS (w/o Expanded)Backbone=KIMI-VL-A3B-INSTRUCT2026.04 | 77.12 | |
| GPT-4o2024.08 | 76.2 | |
| CAI-MoE (Expanded)Backbone=KIMI-VL-A3B-INSTRUCT2026.04 | 73.84 | |
| VAPOModel Scale=7B2025.09 | 71.9 | |
| CAI-MoE (Token Drop)Backbone=KIMI-VL-A3B-INSTRUCT2026.04 | 71.27 | |
| V-R1Model Scale=7B2025.09 | 71.1 | |
| VLAAModel Scale=7B2025.09 | 70 | |
| Top-k RoutingExpert skipping ratio (ρ)=0, Number of experts (k)=8, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 69.93 | |
| Top-k RoutingExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 68.67 | |
| MC-MoEExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 68.67 | |
| MoDESExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 68.41 | |
| DiEPExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 68.13 | |
| MoDESExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 67.92 | |
| MoDESExpert skipping ratio (ρ)=0.85, Number of experts (k)=1, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 67.8 | |
| NAEEExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 67.57 | |
| MC-MoEExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 66.41 | |
| MC-MoEExpert skipping ratio (ρ)=0.85, Number of experts (k)=1, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 65.41 | |
| DiEPExpert skipping ratio (ρ)=0.85, Number of experts (k)=1, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 65.32 | |
| DiEPExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 65.27 | |
| R1-OVModel Scale=7B2025.09 | 65.2 | |
| Qwen-VLModel Scale=7B2025.09 | 64.8 | |
| LLaVA-OneVision-72BModel Scale=72B2024.08 | 63.7 | |
| Ovis2.5Parameter Scale=9B2026.01 | 62.2 | |
| Qwen2-VL-7BModel=Qwen2-VL-7B2026.01 | 62 | |
| VisionTrim on Qwen2-VL-7BModel=Qwen2-VL-7B, Tokens per image=approx. 1/3 original2026.01 | 61.8 | |
| NAEEExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 61.38 | |
| Qwen3-VLParameter Scale=8B2026.01 | 61.2 | |
| GLM-4.6V-FlashX2026.01 | 61 | |
| Qwen2.5-VLParameter Scale=72B2026.01 | 59.2 | |
| VisionTrim on LLaVA-OneVision-7BModel=LLaVA-OneVision-7B, Tokens per image=2432026.01 | 59 | |
| LLaVA-OneVision-7BModel Scale=7B2024.08 | 57.5 | |
| LLaVA-OneVision-7BModel=LLaVA-OneVision-7B, Tokens per image=7292026.01 | 57.5 | |
| Top-k RoutingExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 56.42 | |
| InternVL3.5Parameter Scale=8B2026.01 | 50.6 | |
| LATTETraining Data Size=293K2024.12 | 50 | |
| GPT-4VVersion=V-Preview2024.08 | 49.9 | |
| NAEEExpert skipping ratio (ρ)=0.85, Number of experts (k)=1, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 49.52 | |
| LATTETraining Data Size=98K2024.12 | 47.9 | |
| CogCoMTraining Data Size=70K2024.12 | 46.1 | |
| Ostrakon-VLParameter Scale=8B2026.01 | 36.4 | |
| Top-k RoutingExpert skipping ratio (ρ)=0.85, Number of experts (k)=1, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 35.05 | |
| LLaVA-PlusTraining Data Size=158K2024.12 | 35 | |
| LLaVA-OneVision-0.5BModel Scale=0.5B2024.08 | 29.1 |