Chart Understanding on ChartQA
91.2AccuracySocratic-Geo
Evaluation Results
| Method | Links | |
|---|---|---|
| Socratic-Geo2026.02 | 91.2 | |
| InternVL3-78BModel Category=Open-Source MLLMs2025.12 | 89.7 | |
| Qwen2.5-VL-72BModel Category=Open-Source MLLMs2025.12 | 89.5 | |
| Gemini 3-Pro2026.02 | 89.44 | |
| DeepEyesV2Tool=General, Param Size=7B2025.11 | 88.4 | |
| LLaDA-oModel Architecture Style=Diff. Based2026.03 | 87.9 | |
| ERNIE 5.02026.02 | 87.8 | |
| CodeDance-7BModel Category=Open-Source MLLMs with Tools2025.12 | 87.5 | |
| InternVL3.5-30B-A3BInference scheme=no-thinking2026.04 | 87.4 | |
| Base Model2026.02 | 87.3 | |
| Vanilla MoEBackbone=KIMI-VL-A3B-INSTRUCT, Base Capacity Factor=1.02026.04 | 87.26 | |
| MACS (Ours)Backbone=KIMI-VL-A3B-INSTRUCT, Base Capacity Factor=1.02026.04 | 87.14 | |
| OmniInference scheme=no-thinking2026.04 | 86.9 | |
| Qwen3-VL-30B-A3B-InstructInference scheme=no-thinking2026.04 | 86.8 | |
| GPT-4oModel Category=Closed-Source MLLMs2025.12 | 86.7 | |
| MACS (w/o Expanded)Backbone=KIMI-VL-A3B-INSTRUCT, Base Capacity Factor=1.02026.04 | 86.68 | |
| InternVL3Tool=✗, Param Size=8B2025.11 | 86.6 | |
| Qwen2.5-VL-7BModel Category=Open-Source MLLMs2025.12 | 86.3 | |
| Qwen2.5-VLTool=✗, Param Size=7B2025.11 | 86.2 | |
| InternVL3-8BModel Category=Open-Source MLLMs2025.12 | 86.1 | |
| Thyme-VL-7BModel Category=Open-Source MLLMs with Tools2025.12 | 86.1 | |
| ThymeTool=Code, Param Size=7B2025.11 | 86.1 | |
| InternVL-3.5-4BModel Scale=4B2026.02 | 86 | |
| GPT-4o2024.08 | 85.7 | |
| Latent DenoisingArchitecture=Qwen-2.5-VL2026.04 | 85.4 | |
| Vanilla MoEBackbone=QWEN3-VL-30B-A3B-INSTRUCT, Base Capacity Factor=1.02026.04 | 85.36 | |
| DenseMLLM-4BModel Scale=4B2026.02 | 85.3 | |
| MACS (Ours)Backbone=QWEN3-VL-30B-A3B-INSTRUCT, Base Capacity Factor=1.02026.04 | 85.22 | |
| MACS (w/o Expanded)Backbone=QWEN3-VL-30B-A3B-INSTRUCT, Base Capacity Factor=1.02026.04 | 84.89 | |
| Qwen3-VLmode=Thinking2026.02 | 84.6 | |
| Qwen3-VL-4BModel Scale=4B2026.02 | 84.6 | |
| Vanilla MoEBackbone=INTERNVL3.5-30B-A3B, Base Capacity Factor=1.02026.04 | 84.14 | |
| Gemini 2.5-Pro2026.02 | 84.08 | |
| Top-k RoutingExpert skipping ratio (ρ)=0, Number of experts (k)=8, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 84.08 | |
| Qwen2.5-VL 3B (reported)Res.=Native2025.12 | 84 | |
| MACS (Ours)Backbone=INTERNVL3.5-30B-A3B, Base Capacity Factor=1.02026.04 | 83.98 | |
| CAI-MoE (Expanded)Backbone=KIMI-VL-A3B-INSTRUCT, Base Capacity Factor=1.02026.04 | 83.91 | |
| Gemini 2.5 FlashSize=-2025.10 | 83.79 | |
| LLaVA-OneVision-72BModel Scale=72B2024.08 | 83.7 | |
| Llava-OneVision-72BModel Category=Open-Source MLLMs2025.12 | 83.7 | |
| RISEBackbone=Qwen3-VL-8B-Instruct, Self-evolving steps=602026.05 | 83.64 | |
| Qwen2.5-VL 3B (reproduced)Res.=≤ 896²2025.12 | 83.5 | |
| MACS (w/o Expanded)Backbone=INTERNVL3.5-30B-A3B, Base Capacity Factor=1.02026.04 | 83.47 | |
| Gemini 2.5 ProAccess=Close-source2026.02 | 83.3 | |
| MC-MoEExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 83.22 | |
| MoDESExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 83.15 | |
| NAEEExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 83.02 | |
| BaselineArchitecture=Qwen-2.5-VL2026.04 | 83 | |
| InternVL2.5-8BModel Category=Open-Source MLLMs2025.12 | 82.8 | |
| DiEPExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 82.79 | |
| MoDESExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 82.54 | |
| CASA⊕ Qwen2.5-VLRes.=≤ 896²2025.12 | 82.4 | |
| Semantic-back-7BParameters=7B2026.02 | 82.32 | |
| SAYO-InternVL-8BBase Model=InternVL3.5-8B2026.02 | 82.28 | |
| RISEBackbone=Qwen3-VL-8B-Instruct, Self-evolving steps=202026.05 | 82.28 | |
| RISEBackbone=Qwen3-VL-8B-Instruct, Self-evolving steps=402026.05 | 82.24 | |
| NoisyRollout-7BParameters=7B2026.02 | 82.16 | |
| Kimi-VL-16BParameters=16B2026.02 | 82.08 | |
| RISEBackbone=Qwen2.5-VL-7B-Instruct, Self-evolving steps=602026.05 | 82.08 | |
| Qwen2.5-VLSize=72B2025.10 | 82.03 | |
| Sparse-LaViDa2025.12 | 82 | |
| MoDESExpert skipping ratio (ρ)=0.85, Number of experts (k)=1, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 82 | |
| SAYO-Qwen-4BBase Model=Qwen3-VL-4B2026.02 | 81.96 | |
| SAYO-Qwen-8BBase Model=Qwen3-VL-8B2026.02 | 81.84 | |
| RISEBackbone=Qwen2.5-VL-7B-Instruct, Self-evolving steps=402026.05 | 81.84 | |
| InternVL3.5-14BParameters=14B2026.02 | 81.76 | |
| RISEBackbone=Qwen2.5-VL-7B-Instruct, Self-evolving steps=202026.05 | 81.68 | |
| InternVL3.5-38BParameters=38B2026.02 | 81.6 | |
| InsertionHe-2B# train tokens=0.1T, Architecture Category=Token Insertion – Public data, LLM Size=2B2025.12 | 81.6 | |
| CAI-MoE (Expanded)Backbone=QWEN3-VL-30B-A3B-INSTRUCT, Base Capacity Factor=1.02026.04 | 81.57 | |
| GeoFocusModel Scale=7B2026.02 | 81.5 | |
| Base ModelBackbone=Qwen3-VL-8B-Instruct, Self-evolving steps=02026.05 | 81.44 | |
| Top-k RoutingExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 81.38 | |
| GRPOModel Scale=7B2026.02 | 81.3 | |
| InternVL3.5-30B-A3BParameters=30B-A3B2026.02 | 81.2 | |
| CAI-MoE (Token Drop)Backbone=KIMI-VL-A3B-INSTRUCT, Base Capacity Factor=1.02026.04 | 81.04 | |
| GPT-5Size=-2025.10 | 80.85 | |
| InternVL3.5Size=38B2025.10 | 80.44 | |
| Llava-OneVision-7BModel Category=Open-Source MLLMs2025.12 | 80.4 | |
| Qwen3-VL-4BParameters=4B2026.02 | 80.12 | |
| LLaVA-OneVision-7BModel Scale=7B2024.08 | 80 | |
| LaViDa-O2025.12 | 80 | |
| LaViDa-OModel Architecture Style=Diff. Based2026.03 | 80 | |
| LLaVA-OVTool=✗, Param Size=7B2025.11 | 80 | |
| VideoLLaMA3Architecture Category=Token Insertion – Proprietary2025.12 | 79.8 | |
| Base ModelBackbone=Qwen2.5-VL-7B-Instruct, Self-evolving steps=02026.05 | 79.48 | |
| CAI-MoE (Expanded)Backbone=INTERNVL3.5-30B-A3B, Base Capacity Factor=1.02026.04 | 79.28 | |
| InternVL2.5# train tokens=0.5T, Architecture Category=Token Insertion – Proprietary2025.12 | 79.2 | |
| CAI-MoE (Token Drop)Backbone=QWEN3-VL-30B-A3B-INSTRUCT, Base Capacity Factor=1.02026.04 | 79.13 | |
| InternVL3.5-8BParameters=8B2026.02 | 79.12 | |
| DiEPExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 79.12 | |
| BaselineModel Scale=7B2026.02 | 79 | |
| Qwen3-VL-8BParameters=8B2026.02 | 78.96 | |
| GPT-4VVersion=V-Preview2024.08 | 78.5 | |
| Qwen3-VL-30B-A3BParameters=30B-A3B2026.02 | 78.42 | |
| LLaDA-VModel Architecture Style=Diff. Based2026.03 | 78.3 | |
| GPT-5tier=High2026.02 | 78.24 | |
| MC-MoEExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 78.24 | |
| Deepeyes-7BModel Category=Open-Source MLLMs with Tools, reproduced=true2025.12 | 78.2 | |
| Qwen2.5-VLSize=7B2025.10 | 78.12 |