Multimodal Understanding on MMT
77.2AccuracyGPT-5-high
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5-highSize=-2026.06 | 77.2 | |
| Gemini-2.5-ProSize=-2026.06 | 75.4 | |
| CoLTSize=8B, Backbone=Qwen3-VL-8B2026.06 | 67.4 | |
| InternVL3Size=8B2026.06 | 65 | |
| Qwen3-VL (Textual reasoning)Size=8B2026.06 | 63.3 | |
| LVRSize=7B2026.06 | 62.6 | |
| SIM-CoTSize=8B, Backbone=Qwen3-VL-8B2026.06 | 62.4 | |
| SoftCoTSize=8B, Backbone=Qwen3-VL-8B2026.06 | 60.6 | |
| CODISize=8B, Backbone=Qwen3-VL-8B2026.06 | 59.1 | |
| Multimodal CoTSize=8B, Backbone=Qwen3-VL-8B2026.06 | 58.3 | |
| ICoTSize=8B, Backbone=Qwen3-VL-8B2026.06 | 57.9 | |
| CCoTSize=8B, Backbone=Qwen3-VL-8B2026.06 | 57.1 | |
| Qwen3-VL (Direct answer)Size=8B2026.06 | 55.6 | |
| LLaVA-NEXT-3BBackbone=LLaVA-NEXT-3B2026.05 | 51.7 | |
| LBRBackbone=LLaVA-NEXT-3B2026.05 | 51.7 | |
| LBRBackbone=LLaVA-1.5-13B2026.05 | 49.5 | |
| LLaVA-1.5-13BBackbone=LLaVA-1.5-13B2026.05 | 48.8 | |
| LBRBackbone=LLaVA-1.5-7B2026.05 | 47.5 | |
| LLaVA-1.5-7BBackbone=LLaVA-1.5-7B2026.05 | 47.4 |