Image Understanding on MME
2,500ScoreVanilla MoE
Evaluation Results
| Method | Links | |
|---|---|---|
| Vanilla MoEBackbone=QWEN3-VL-30B-A3B-INSTRUCT2026.04 | 2,500 | |
| MACS (Ours)Backbone=QWEN3-VL-30B-A3B-INSTRUCT2026.04 | 2,492 | |
| MACS (w/o Expanded)Backbone=QWEN3-VL-30B-A3B-INSTRUCT2026.04 | 2,478 | |
| BAGEL-Uni-Edit (Ours)Training Stage=Stage 22026.05 | 2,412 | |
| BAGEL-Uni-Edit (Ours)Training Stage=Stage 12026.05 | 2,405 | |
| BAGEL2026.05 | 2,381 | |
| BAGEL-RecA2026.05 | 2,381 | |
| Uni-Edit w/o joint trainingjoint training=false2026.05 | 2,381 | |
| Uni-Edit w/o VAE dropoutVAE dropout=false2026.05 | 2,344 | |
| Uni-Edit ViT (und.) 224x980Resolution=224x9802026.05 | 2,326 | |
| Vanilla MoEBackbone=INTERNVL3.5-30B-A3B2026.04 | 2,324 | |
| Uni-Edit ViT (und.) 224x224Resolution=224x2242026.05 | 2,324 | |
| MACS (Ours)Backbone=INTERNVL3.5-30B-A3B2026.04 | 2,315 | |
| BAGEL-AnyEdit2026.05 | 2,314 | |
| Top-k RoutingExpert skipping ratio (ρ)=0, Number of experts (k)=8, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 2,312 | |
| Uni-Edit ViT (und.) 378x980Resolution=378x9802026.05 | 2,307 | |
| CAI-MoE (Expanded)Backbone=QWEN3-VL-30B-A3B-INSTRUCT2026.04 | 2,305 | |
| MACS (w/o Expanded)Backbone=INTERNVL3.5-30B-A3B2026.04 | 2,298 | |
| MoDESExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 2,289 | |
| MoDESExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 2,258 | |
| MoDESExpert skipping ratio (ρ)=0.85, Number of experts (k)=1, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 2,222 | |
| Vanilla MoEBackbone=KIMI-VL-A3B-INSTRUCT2026.04 | 2,218 | |
| CAI-MoE (Token Drop)Backbone=QWEN3-VL-30B-A3B-INSTRUCT2026.04 | 2,214 | |
| MACS (Ours)Backbone=KIMI-VL-A3B-INSTRUCT2026.04 | 2,212 | |
| Kimi-VL-A3B-Instructk=6, Status=Default2025.11 | 2,207 | |
| MoDESSkip x% Experts=67%, rho=0.652025.11 | 2,204 | |
| MoDESSkip x% Experts=50%, rho=0.482025.11 | 2,203 | |
| MACS (w/o Expanded)Backbone=KIMI-VL-A3B-INSTRUCT2026.04 | 2,198 | |
| MC-MoEExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 2,192 | |
| MoDESSkip x% Experts=83%, rho=0.82025.11 | 2,162 | |
| CAI-MoE (Expanded)Backbone=INTERNVL3.5-30B-A3B2026.04 | 2,147 | |
| CAI-MoE (Expanded)Backbone=KIMI-VL-A3B-INSTRUCT2026.04 | 2,096 | |
| DiEPExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 2,084 | |
| +Uni-Edit (Ours)Base Model=Janus-Pro2026.05 | 2,067 | |
| CAI-MoE (Token Drop)Backbone=INTERNVL3.5-30B-A3B2026.04 | 2,056 | |
| NAEEExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 2,054 | |
| MC-MoEExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 2,037 | |
| DiEPExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 2,021 | |
| CAI-MoE (Token Drop)Backbone=KIMI-VL-A3B-INSTRUCT2026.04 | 2,013 | |
| Janus-Pro2026.05 | 1,978 | |
| MC-MoEExpert skipping ratio (ρ)=0.85, Number of experts (k)=1, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 1,972 | |
| NAEEExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 1,968 | |
| Top-k RoutingExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 1,964 | |
| VanillaBase Model=LLaVA-1.5-7B, Retained Tokens=576, Reduction Rate=0%2026.02 | 1,862 | |
| DiEPExpert skipping ratio (ρ)=0.85, Number of experts (k)=1, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 1,838 | |
| Top-k RoutingExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 1,821 | |
| ApETBase Model=LLaVA-1.5-7B, Retained Tokens=192, Reduction Rate=66.7%2026.02 | 1,808 | |
| NAEEExpert skipping ratio (ρ)=0.85, Number of experts (k)=1, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 1,802 | |
| ApETBase Model=LLaVA-1.5-7B, Retained Tokens=128, Reduction Rate=77.8%2026.02 | 1,801 | |
| PDropBase Model=LLaVA-1.5-7B, Retained Tokens=192, Reduction Rate=66.7%2026.02 | 1,797 | |
| VisionZipBase Model=LLaVA-1.5-7B, Retained Tokens=192, Reduction Rate=66.7%2026.02 | 1,783 | |
| VisionZipBase Model=LLaVA-1.5-7B, Retained Tokens=128, Reduction Rate=77.8%2026.02 | 1,763 | |
| PDropBase Model=LLaVA-1.5-7B, Retained Tokens=128, Reduction Rate=77.8%2026.02 | 1,761 | |
| SparseVLMBase Model=LLaVA-1.5-7B, Retained Tokens=192, Reduction Rate=66.7%2026.02 | 1,721 | |
| ApETBase Model=LLaVA-1.5-7B, Retained Tokens=64, Reduction Rate=88.9%2026.02 | 1,714 | |
| SparseVLMBase Model=LLaVA-1.5-7B, Retained Tokens=128, Reduction Rate=77.8%2026.02 | 1,696 | |
| VisionZipBase Model=LLaVA-1.5-7B, Retained Tokens=64, Reduction Rate=88.9%2026.02 | 1,690 | |
| Top-k RoutingExpert skipping ratio (ρ)=0.85, Number of experts (k)=1, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 1,683 | |
| FastVBase Model=LLaVA-1.5-7B, Retained Tokens=192, Reduction Rate=66.7%2026.02 | 1,612 | |
| ToMeBase Model=LLaVA-1.5-7B, Retained Tokens=192, Reduction Rate=66.7%2026.02 | 1,563 | |
| PDropBase Model=LLaVA-1.5-7B, Retained Tokens=64, Reduction Rate=88.9%2026.02 | 1,561 | |
| SparseVLMBase Model=LLaVA-1.5-7B, Retained Tokens=64, Reduction Rate=88.9%2026.02 | 1,505 | |
| FastVBase Model=LLaVA-1.5-7B, Retained Tokens=128, Reduction Rate=77.8%2026.02 | 1,490 | |
| ToMeBase Model=LLaVA-1.5-7B, Retained Tokens=128, Reduction Rate=77.8%2026.02 | 1,343 | |
| FastVBase Model=LLaVA-1.5-7B, Retained Tokens=64, Reduction Rate=88.9%2026.02 | 1,256 | |
| ToMeBase Model=LLaVA-1.5-7B, Retained Tokens=64, Reduction Rate=88.9%2026.02 | 1,138 |