Vision-Language Perception and Reasoning on MMStar (accuracy)
64.3Accuracy (MMStar)Qwen2.5-VL
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-VLScale=32B2026.05 | 64.3 | |
| Phi4-multimodal + DRScaffoldScale=5.6B2026.05 | 59.8 | |
| Phi4-multimodalScale=5.6B2026.05 | 59.1 | |
| Qwen2.5-VL + DRScaffoldScale=3B2026.05 | 54.9 | |
| Qwen2.5-VLScale=3B2026.05 | 54.2 | |
| InternVL2.5Scale=2B2026.05 | 53.8 | |
| InternVL2.5 + DRScaffoldScale=2B2026.05 | 52.3 | |
| SECONDModel=LLaVA-OneVision (SigLIP-384), LLM=Qwen2-0.5B, CD=✓2025.06 | 39.9 | |
| SECONDModel=Yi-VL (CLIP-448), LLM=Yi-6B, CD=✓2025.06 | 39.8 | |
| SECONDModel=LLaVA-OneVision (SigLIP-384), LLM=Qwen2-0.5B, CD=✗2025.06 | 39.6 | |
| baselineModel=LLaVA-OneVision (SigLIP-384), LLM=Qwen2-0.5B, CD=✗2025.06 | 38.9 | |
| SECONDModel=LLaVA-Next (CLIP-336), LLM=Vicuna-7B, CD=✓2025.06 | 38.6 | |
| VCDModel=LLaVA-Next (CLIP-336), LLM=Vicuna-7B, CD=✓2025.06 | 38.1 | |
| SECONDModel=LLaVA-Next (CLIP-336), LLM=Vicuna-7B, CD=✗2025.06 | 37.5 | |
| SECONDModel=Yi-VL (CLIP-448), LLM=Yi-6B, CD=✗2025.06 | 37.4 | |
| baselineModel=LLaVA-Next (CLIP-336), LLM=Vicuna-7B, CD=✗2025.06 | 37.3 | |
| SECONDModel=LLaVA-Next (CLIP-336), LLM=Mistral-7B, CD=✓2025.06 | 36.2 | |
| VCDModel=LLaVA-OneVision (SigLIP-384), LLM=Qwen2-0.5B, CD=✓2025.06 | 36.2 | |
| baselineModel=Yi-VL (CLIP-448), LLM=Yi-6B, CD=✗2025.06 | 34.8 | |
| VCDModel=Yi-VL (CLIP-448), LLM=Yi-6B, CD=✓2025.06 | 34.4 | |
| SECONDModel=LLaVA-Next (CLIP-336), LLM=Mistral-7B, CD=✗2025.06 | 34.1 | |
| VCDModel=LLaVA-Next (CLIP-336), LLM=Mistral-7B, CD=✓2025.06 | 34 | |
| baselineModel=LLaVA-Next (CLIP-336), LLM=Mistral-7B, CD=✗2025.06 | 32.4 |