Multimodal Perception and Grounding on MME-RealWorld
51.94ScoreSceneAlign
Evaluation Results
| Method | Links | |
|---|---|---|
| SceneAlignModel=InternVL3-8B2026.01 | 51.94 | |
| SFTModel=InternVL3-8B2026.01 | 50.33 | |
| BaseModel=InternVL3-8B2026.01 | 49.6 | |
| SceneAlignModel=Qwen3-VL-4B2026.01 | 48.86 | |
| BaseModel=Qwen3-VL-4B2026.01 | 47.99 | |
| SFTModel=Qwen3-VL-4B2026.01 | 47.36 | |
| SceneAlignModel=Qwen2.5-VL-7B2026.01 | 45.02 | |
| SFTModel=Qwen2.5-VL-7B2026.01 | 44.45 | |
| BaseModel=Qwen2.5-VL-7B2026.01 | 43.98 | |
| SceneAlignModel=Qwen2.5-VL-3B2026.01 | 40.42 | |
| SFTModel=Qwen2.5-VL-3B2026.01 | 39.81 | |
| SceneAlignModel=LLaVA-Next-8B2026.01 | 39.42 | |
| SFTModel=LLaVA-Next-8B2026.01 | 38.95 | |
| BaseModel=Qwen2.5-VL-3B2026.01 | 38.32 | |
| LLaVA-ReasonerModel=LLaVA-Next-8B2026.01 | 37.68 | |
| AoTModel=LLaVA-Next-8B2026.01 | 37.68 | |
| BaseModel=LLaVA-Next-8B2026.01 | 37.26 |