Mathematical Reasoning on MathVista (Metric: MathVista)
74.8MathVistaCategory-balanced
Evaluation Results
| Method | Links | |
|---|---|---|
| Category-balancedBase policy=Qwen3-VL-8B2026.05 | 74.8 | |
| POW3R dynamicBase policy=Qwen3-VL-8B2026.05 | 74.6 | |
| Static scalarBase policy=Qwen3-VL-8B2026.05 | 74.1 | |
| BinaryBase policy=Qwen3-VL-8B2026.05 | 73.8 | |
| BaseBase policy=Qwen3-VL-8B2026.05 | 73.6 | |
| POW3R dynamicBase policy=Qwen3-VL-4B2026.05 | 73.2 | |
| BAGEL#Params=7B MoT, Model Category=Unified Multimodal Large Language Models, Co-training=false2026.05 | 73.1 | |
| Category-balancedBase policy=Qwen3-VL-4B2026.05 | 72.8 | |
| Static scalarBase policy=Qwen3-VL-4B2026.05 | 72.2 | |
| BinaryBase policy=Qwen3-VL-4B2026.05 | 71.2 | |
| BaseBase policy=Qwen3-VL-4B2026.05 | 71 | |
| Kimi-VL#Params=3B/16B, Model Category=Vision Language Models, Co-training=false2026.05 | 68.7 | |
| Qwen2.5-VL#Params=7B, Model Category=Vision Language Models, Co-training=false2026.05 | 68.2 | |
| UAM#Params=7B MoT, Model Category=Vision-Language-Action Models, Co-training=false2026.05 | 68.2 | |
| LLava-OV#Params=7B, Model Category=Vision Language Models, Co-training=false2026.05 | 63.2 | |
| DeepSeek-VL2#Params=4B/27B, Model Category=Vision Language Models, Co-training=false2026.05 | 62.8 | |
| Qwen2.5-VL#Params=3B, Model Category=Vision Language Models, Co-training=false2026.05 | 62.3 | |
| Qwen2-VL#Params=7B, Model Category=Vision Language Models, Co-training=false2026.05 | 58.2 | |
| GRACEData %=15%2026.05 | 54.3 | |
| GRACEData %=20%2026.05 | 54.2 | |
| CADCData %=20%2026.05 | 54 | |
| GRACEData %=10%2026.05 | 53 | |
| StepmaxData %=20%2026.05 | 52.6 | |
| FullData %=100%2026.05 | 52.5 | |
| RandomData %=20%2026.05 | 52.3 | |
| GRACEData %=5%2026.05 | 51.9 | |
| LongestData %=20%2026.05 | 51.3 | |
| ICONSData %=20%2026.05 | 51 | |
| LESSData %=20%2026.05 | 49.9 | |
| Category-balancedBase policy=Gemma3-4B2026.05 | 49.8 | |
| POW3R dynamicBase policy=Gemma3-4B2026.05 | 49.6 | |
| Static scalarBase policy=Gemma3-4B2026.05 | 48 | |
| BinaryBase policy=Gemma3-4B2026.05 | 47.6 | |
| BaseBase policy=Gemma3-4B2026.05 | 47.5 | |
| Qwen2-VL#Params=1.5B, Model Category=Vision Language Models, Co-training=false2026.05 | 43 | |
| Cambrian-8B-CLIP-LKV Size=5762026.05 | 37.3 | |
| Cambrian-8B-DINOv2-LKV Size=5762026.05 | 35.5 | |
| Cambrian-4B + TokenCompre. + Gaze attentionKV Size=54+42026.05 | 31.1 | |
| Cambrian-4B + TokenCompre. + Gaze attentionKV Size=36+42026.05 | 30.7 | |
| LLaVA-Next-Qwen2-7BKV Size=7842026.05 | 30 | |
| LLaVA-OV-7BKV Size=1962026.05 | 26.3 | |
| Qwen2.5-VL-3BKV Size=2562026.05 | 23.3 | |
| Qwen2.5-VL-3B + InfiniPot-VKV Size=1282026.05 | 21.8 | |
| LLaVA-OV-7B + HERMESKV Size=1002026.05 | 21 | |
| Cambrian-4B + Gaze attentionKV Size=72+42026.05 | 19.7 | |
| Cambrian-4B + Gaze attentionKV Size=144+42026.05 | 19.1 | |
| Qwen2.5-VL-3B + InfiniPot-VKV Size=502026.05 | 18 | |
| Cambrian-4B + TokenCompre.KV Size=1442026.05 | 17.6 | |
| Cambrian-4BKV Size=5762026.05 | 17.5 | |
| Cambrian-4B + Gaze attentionKV Size=288+42026.05 | 17.5 | |
| LLaVA-OV-7B + HERMESKV Size=402026.05 | 16.8 | |
| LLaVA-Next-LLaMA-3-8BKV Size=7842026.05 | 11.8 | |
| BLIP-2-7BKV Size=5762026.05 | 11.3 | |
| SPHINX-7B2026.05 | 9.8 | |
| OpenVLA#Params=7B, Model Category=Vision-Language-Action Models, Co-training=false2026.05 | 0 |