Multi-modal Question Answering on MMStar
81AccuracyQwen3.5-27B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3.5-27BMode=REASONING, Architecture=Dense, # Total Params=27B, # Activated Params=27B2026.04 | 81 | |
| Qwen3-VL-32BMode=Thinking, Architecture=Dense, # Total Params=33B, # Activated Params=33B2026.04 | 79.4 | |
| Qwen3-VL-235B-A22BMode=Thinking, Architecture=MoE, # Total Params=236B, # Activated Params=23B2026.04 | 78.7 | |
| EXAONE 4.5 33BMode=REASONING, Architecture=Dense, # Total Params=33B, # Activated Params=33B2026.04 | 74.9 | |
| GPT-5 miniMode=REASONING: HIGH, Architecture=-, # Total Params=-, # Activated Params=-2026.04 | 74.1 | |
| OneVision-8BModel=OneVision-8B2026.06 | 68.1 | |
| OneVision-4BModel=OneVision-4B2026.06 | 65.2 | |
| MergeMixbaseline=SFT Vision2025.10 | 62.92 | |
| HART-7BResolution=511 × 3912026.02 | 62.8 | |
| SFT Vision2025.10 | 62.66 | |
| Qwen2.5-VL-Ins-7B2025.10 | 62.42 | |
| VisionThink-7B2025.10 | 61 | |
| InternVL2-8BModel=InternVL2-8B2026.06 | 59.6 | |
| Qwen2.5-VL-7BResolution=511 × 3912026.02 | 59.3 | |
| LLaVA-OneVision-7BResolution=511 × 3912026.02 | 56.7 | |
| OneVision-4B-LNModel=OneVision-4B-LN2026.06 | 55.8 | |
| InternVL3-7BResolution=511 × 3912026.02 | 53.5 | |
| Llama-90BModel=Llama-90B2026.06 | 52.7 | |
| Cambrian-8BModel=Cambrian-8B2026.06 | 47.5 | |
| LLaVA-13BModel=LLaVA-13B2026.06 | 36.5 | |
| LLaVA-7BModel=LLaVA-7B2026.06 | 33.6 |