Multi-discipline Multimodal Reasoning on MMMU
61.3AccuracySophiaVL-R1-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| SophiaVL-R1-7BParameters=7B2025.05 | 61.3 | |
| Qwen2.5-VL-7B-InstructParameters=7B, Training Strategy=SFT+GRPO2025.05 | 59.1 | |
| Qwen2.5-VL-7B-InstructParameters=7B, Training Strategy=Direct2025.05 | 58.7 | |
| Qwen2.5-VL-7B-InstructParameters=7B, Training Strategy=GRPO2025.05 | 58 | |
| LLaVA-OneVision-72BParameters=72B2025.05 | 56.8 | |
| GPT-4V2025.05 | 56.8 | |
| InternVL2.5-8B-VisualPRMParameters=8B2025.05 | 56.2 | |
| R1-Onevision-7BParameters=7B2025.05 | 51.6 | |
| Cambrian-1-34BParameters=34B2025.05 | 49.7 | |
| LLaVA-OneVision-7BParameters=7B2025.05 | 48.8 | |
| URSA-8BParameters=8B2025.05 | 43.1 | |
| VanillaBackbone=LLaVA-1.5-13B, Vision token count=1442026.03 | 36.1 | |
| QMoPBackbone=LLaVA-1.5-13B, Vision token count=1442026.03 | 36.1 | |
| LDP-v2Backbone=LLaVA-1.5-13B, Vision token count=1442026.03 | 35.6 | |
| C-AbstractorBackbone=LLaVA-1.5-13B, Vision token count=1442026.03 | 35.4 | |
| QMoPBackbone=LLaVA-1.5-7B, Vision token count=1442026.03 | 35.1 | |
| TokenPackerBackbone=LLaVA-1.5-13B, Vision token count=1442026.03 | 35 | |
| FasterVLMBackbone=LLaVA-1.5-13B, Vision token count=1442026.03 | 34.9 | |
| FasterVLMBackbone=LLaVA-1.5-7B, Vision token count=1442026.03 | 34.8 | |
| MQT-LLaVABackbone=LLaVA-1.5-7B, Vision token count=1442026.03 | 34.8 | |
| VanillaBackbone=LLaVA-1.5-7B, Vision token count=1442026.03 | 34.6 | |
| Pixel-ShuffleBackbone=LLaVA-1.5-7B, Vision token count=642026.03 | 34.6 | |
| FasterVLMBackbone=LLaVA-1.5-7B, Vision token count=642026.03 | 34.6 | |
| QMoPBackbone=LLaVA-1.5-7B, Vision token count=642026.03 | 34.6 | |
| MQT-LLaVABackbone=LLaVA-1.5-7B, Vision token count=642026.03 | 34.4 | |
| Pixel-ShuffleBackbone=LLaVA-1.5-13B, Vision token count=1442026.03 | 34.4 | |
| TokenPackerBackbone=LLaVA-1.5-7B, Vision token count=1442026.03 | 34.3 | |
| LDP-v2Backbone=LLaVA-1.5-7B, Vision token count=642026.03 | 34.2 | |
| C-AbstractorBackbone=LLaVA-1.5-7B, Vision token count=642026.03 | 34.1 | |
| LDP-v2Backbone=LLaVA-1.5-7B, Vision token count=1442026.03 | 33.9 | |
| TokenPackerBackbone=LLaVA-1.5-7B, Vision token count=642026.03 | 33.8 | |
| C-AbstractorBackbone=LLaVA-1.5-7B, Vision token count=1442026.03 | 33.4 | |
| Pixel-ShuffleBackbone=LLaVA-1.5-7B, Vision token count=1442026.03 | 32.7 |