Image Understanding on MMStar
65.1ScoreGPT-4o-2024-11-20
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4o-2024-11-20Version=2024-11-202026.03 | 65.1 | |
| SpatialSSRLBackbone=Qwen2.5-VL-7B2026.04 | 63.5 | |
| ROBOALIGN (Ours)Training=SFT + RL2026.03 | 62.8 | |
| SpatialEvoBackbone=Qwen2.5-VL-7B2026.04 | 62.5 | |
| DCRL2026.06 | 62.5 | |
| Top-k RoutingExpert skipping ratio (ρ)=0, Number of experts (k)=8, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 62.49 | |
| ROBOALIGN w/o RLTraining=SFT only2026.03 | 62.47 | |
| MoDESExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 62.06 | |
| VeBrain-8BParameters=8B2026.03 | 61.9 | |
| DiEPExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 61.82 | |
| BaselineBackbone=Qwen2.5-VL-7B2026.04 | 61.6 | |
| MoDESExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 61.46 | |
| MC-MoEExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 61.45 | |
| MoDESExpert skipping ratio (ρ)=0.85, Number of experts (k)=1, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 61.2 | |
| NAEEExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 61.18 | |
| ViLaSRBackbone=Qwen2.5-VL-7B2026.04 | 60.8 | |
| Top-k RoutingExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 60.3 | |
| Qwen2.5-VL-7B-InsParameters=7B, Variant=Instruct2026.03 | 60.3 | |
| Qwen3-VL-8BModel Size=8B2026.06 | 59.8 | |
| NAEEExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 58.82 | |
| DiEPExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 58.42 | |
| MC-MoEExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 57.65 | |
| DiEPExpert skipping ratio (ρ)=0.85, Number of experts (k)=1, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 57.21 | |
| SpatialSSRLBackbone=Qwen2.5-VL-3B2026.04 | 56.5 | |
| MC-MoEExpert skipping ratio (ρ)=0.85, Number of experts (k)=1, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 56.14 | |
| SpatialEvoBackbone=Qwen2.5-VL-3B2026.04 | 55.2 | |
| SpaceRBackbone=Qwen2.5-VL-7B2026.04 | 54.9 | |
| BaselineBackbone=Qwen2.5-VL-3B2026.04 | 54.6 | |
| Cosmos-Reason1-7BParameters=7B2026.03 | 54.4 | |
| CircleRoPEBackbone=Qwen3-VL-8B-Instruct2025.10 | 54.4 | |
| MRoPE-IBackbone=Qwen3-VL-8B-Instruct2025.10 | 53.47 | |
| VideoRoPEBackbone=Qwen3-VL-8B-Instruct2025.10 | 53.33 | |
| MHRoPEBackbone=Qwen3-VL-8B-Instruct2025.10 | 53.2 | |
| HoPEBackbone=Qwen3-VL-8B-Instruct2025.10 | 52.86 | |
| MRoPEBackbone=Qwen3-VL-8B-Instruct2025.10 | 52.53 | |
| Vanilla RoPEBackbone=Qwen3-VL-8B-Instruct2025.10 | 51.88 | |
| MRoPE-I2025.10 | 51.13 | |
| HoPE2025.10 | 50.33 | |
| NAEEExpert skipping ratio (ρ)=0.85, Number of experts (k)=1, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 50.14 | |
| MRoPE2025.10 | 49.93 | |
| VideoRoPE2025.10 | 49.6 | |
| MHRoPE2025.10 | 49.6 | |
| Vanilla RoPE2025.10 | 49.13 | |
| CircleRoPE2025.10 | 47 | |
| Top-k RoutingExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 46.69 | |
| SpatialLadderBackbone=Qwen2.5-VL-3B2026.04 | 45.8 | |
| MRoPE-IBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MRoPE-I2025.10 | 45 | |
| SpaceRBackbone=Qwen2.5-VL-3B2026.04 | 44.9 | |
| CircleRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=CircleRoPE2025.10 | 43.73 | |
| MHRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MHRoPE2025.10 | 43.73 | |
| Vanilla RoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=Vanilla RoPE2025.10 | 43.67 | |
| HoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=HoPE2025.10 | 43.53 | |
| MRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MRoPE2025.10 | 42.87 | |
| Top-k RoutingExpert skipping ratio (ρ)=0.85, Number of experts (k)=1, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 42.27 | |
| VideoRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=VideoRoPE2025.10 | 41.87 | |
| RoboBrain2.0-7BVersion=2.0, Parameters=7B2026.03 | 35.8 |