General Visual Understanding on MMMU
75.1AccuracyClaude4-Sonnet
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Claude4-Sonnet2026.02 | 75.1 | 64.1 | |
| Qwen2.5-VL-72BParameters=72B2026.02 | 70.2 | 61.9 | |
| DPEBackbone=Qwen3-VL-8B-Instruct, Iteration=32026.02 | 69.11 | 64.39 | |
| GPT-4o2026.02 | 69.1 | 56.1 | |
| GPT5-Mini2026.02 | 67.9 | 53.8 | |
| PDCRBackbone=Qwen3-VL-8B-Instruct2026.05 | 57.1 | — | |
| PACRBackbone=Qwen3-VL-8B-Instruct2026.05 | 56.1 | — | |
| DAPOBackbone=Qwen3-VL-8B-Instruct2026.05 | 55.5 | — | |
| Zero-shot InferenceBackbone=Qwen3-VL-8B-Instruct2026.05 | 55.2 | — | |
| GRPOBackbone=Qwen3-VL-8B-Instruct2026.05 | 55 | — | |
| Vision-SR1Backbone=Qwen2.5-VL-7B2025.08 | 52.2 | 52.2 | |
| Vision-R1Backbone=Qwen2.5-VL-7B, Training Data=47K data2025.08 | 51.8 | 50.7 | |
| PDCRBackbone=Qwen2.5-VL-7B2026.05 | 51.5 | — | |
| DAPOBackbone=Qwen2.5-VL-7B2026.05 | 51 | — | |
| GRPOBackbone=Qwen2.5-VL-7B2026.05 | 50.7 | — | |
| PACRBackbone=Qwen2.5-VL-7B2026.05 | 50.5 | — | |
| Vision-SR1Backbone=Qwen2.5-VL-3B2025.08 | 49.6 | 48.8 | |
| Vision-R1Backbone=Qwen2.5-VL-3B, Training Data=47K data2025.08 | 49.5 | 47.1 | |
| Vision-SR1Backbone=Mimo-VL-7B2025.08 | 49.5 | 49.5 | |
| Vision-R1Backbone=Mimo-VL-7B, Training Data=47K data2025.08 | 47.3 | 46 | |
| Zero-shot InferenceBackbone=Mimo-VL-7B, Inference Protocol=Zero-shot (before RL)2025.08 | 45.6 | 44.4 | |
| PDCRBackbone=Qwen2.5-VL-3B2026.05 | 43.2 | — | |
| Vision-R1 (7B)Backbone=7B2025.08 | 42.8 | 44.5 | |
| Vision-R1Backbone=Vision-R1 (7B)2026.05 | 42.8 | — | |
| PACRBackbone=Qwen2.5-VL-3B2026.05 | 41.2 | — | |
| DAPOBackbone=Qwen2.5-VL-3B2026.05 | 41 | — | |
| Percention-R1 (7B)Backbone=7B2025.08 | 40.9 | 45.2 | |
| Perception-R1Backbone=Perception-R1 (7B)2026.05 | 40.9 | — | |
| GRPOBackbone=Qwen2.5-VL-3B2026.05 | 40.4 | — | |
| Zero-shot InferenceBackbone=Qwen2.5-VL-7B, Inference Protocol=Zero-shot (before RL)2025.08 | 33.5 | 41.5 | |
| Zero-shot InferenceBackbone=Qwen2.5-VL-7B, Mode=Zero-shot2026.05 | 33.3 | — | |
| Visionary-R1 (3B)Backbone=3B2025.08 | 30.6 | 33.9 | |
| Visionary-R1Backbone=Visionary-R1 (3B)2026.05 | 30.6 | — | |
| Zero-shot InferenceBackbone=Qwen2.5-VL-3B, Inference Protocol=Zero-shot (before RL)2025.08 | 25.5 | 35.5 | |
| Zero-shot InferenceBackbone=Qwen2.5-VL-3B, Mode=Zero-shot2026.05 | 24 | — | |
| BaseTeacher=Qwen3-VL-8B, Student=Qwen3-VL-2B, Training Data=Geometry3K, Temperature=1.0, Checkpoint Selection=Best checkpoint2026.05 | — | 49.1 | |
| CoT-SFTTeacher=Qwen3-VL-8B, Student=Qwen3-VL-2B, Training Data=Geometry3K, Temperature=1.0, Checkpoint Selection=Best checkpoint2026.05 | — | 48.7 | |
| GRPOTeacher=Qwen3-VL-8B, Student=Qwen3-VL-2B, Training Data=Geometry3K, Temperature=1.0, Checkpoint Selection=Best checkpoint2026.05 | — | 52.9 | |
| Off-policy KDTeacher=Qwen3-VL-8B, Student=Qwen3-VL-2B, Training Data=Geometry3K, Temperature=1.0, Checkpoint Selection=Best checkpoint2026.05 | — | 49.3 | |
| OPDTeacher=Qwen3-VL-8B, Student=Qwen3-VL-2B, Training Data=Geometry3K, Temperature=1.0, Checkpoint Selection=Best checkpoint2026.05 | — | 50.9 | |
| PAPOTeacher=Qwen3-VL-8B, Student=Qwen3-VL-2B, Training Data=Geometry3K, Temperature=1.0, Checkpoint Selection=Best checkpoint2026.05 | — | 52.7 | |
| VA-OPDTeacher=Qwen3-VL-8B, Student=Qwen3-VL-2B, Training Data=Geometry3K, Temperature=1.0, Checkpoint Selection=Best checkpoint2026.05 | — | 51.5 |