College-level Reasoning on MMMU (val)
53.1AccuracyQwen2.5VL-3b-Instruct
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5VL-3b-Instruct2026.06 | 53.1 | |
| MoD-Multi RoundBackbone=Qwen2.5VL-3b-Instruct, Protocol=multi-turn dialectical reasoning2026.06 | 49.47 | |
| Self-CorrectionBackbone=Qwen2.5VL-3b-Instruct2026.06 | 48.46 | |
| Multi-Agent DebateBackbone=Qwen2.5VL-3b-Instruct2026.06 | 48.28 | |
| MoE-LoRABackbone=Qwen2.5VL-3b-Instruct2026.06 | 47.97 | |
| Gemma-3-4B2026.06 | 47.3 | |
| MoD-Single RoundBackbone=Qwen2.5VL-3b-Instruct, Protocol=single-round inference2026.06 | 46.44 | |
| MoD-Multi RoundBackbone=LLaVA-v1.6-13b, Protocol=multi-turn dialectical reasoning2026.06 | 38.44 | |
| MoD-Single RoundBackbone=LLaVA-v1.6-13b, Protocol=single-round inference2026.06 | 37.88 | |
| MoE-LoRABackbone=LLaVA-v1.6-13b2026.06 | 37.29 | |
| Qwen-VL-Chat2026.06 | 37 | |
| LLaVA-Next-Mistral-7B2026.06 | 37 | |
| ShareGPT4V-13B2026.06 | 36.6 | |
| Multi-Agent DebateBackbone=LLaVA-v1.6-13b2026.06 | 36.22 | |
| Self-CorrectionBackbone=LLaVA-v1.6-13b2026.06 | 35.66 | |
| LLaVA-v1.6-13b2026.06 | 35 | |
| InstructBLIP-7B2026.06 | 30.6 |