Mathematical Reasoning on MathVista mini (test)
80.2AccuracyQwen2.5-VL-32B + AT-RL (Ours)
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Qwen2.5-VL-32B + AT-RL (Ours)Zero-shot=true2026.02 | 80.2 | — | — | — | — | — | |
| Ours (CDRL + CA-TTS)Framework Type=Training-Based, Base Model=Qwen2.5-VL-7B2026.03 | 79.5 | — | — | — | 74.2 | 84.7 | |
| Qwen2.5-VL-32B + VPPOZero-shot=true2026.02 | 78.3 | — | — | — | — | — | |
| Qwen2.5-VL-72B InstructZero-shot=true2026.02 | 77.8 | — | — | — | — | — | |
| Qwen2.5-VL-32B InstructZero-shot=true2026.02 | 75.7 | — | — | — | — | — | |
| VL-RethinkerFramework Type=Training-Based, Base Model=Qwen2.5-VL-7B2026.03 | 74.1 | — | — | — | 65.3 | 81.7 | |
| Gemini 2.0 FlashZero-shot=true2026.02 | 73.4 | — | — | — | — | — | |
| We-ThinkFramework Type=Training-Based, Base Model=Qwen2.5-VL-7B2026.03 | 73.3 | — | — | — | 65.7 | 80.1 | |
| OpenVLThinker-7BBackbone=Qwen2.5-VL-7B-Instruct2026.01 | 70.8 | — | — | — | — | — | |
| Llama 4 ScoutZero-shot=true2026.02 | 70.7 | — | — | — | — | — | |
| DeepconfFramework Type=Training-Free, Base Model=Qwen2.5-VL-7B2026.03 | 70.7 | — | — | — | 69.3 | 74.7 | |
| Supervised GRPOBackbone=Qwen2.5-VL-7B-Instruct2026.01 | 70.3 | — | — | — | — | — | |
| Majority VotingFramework Type=Training-Free, Base Model=Qwen2.5-VL-7B2026.03 | 69.8 | — | — | — | 68.4 | 73.7 | |
| V-ZeroBackbone=Qwen2.5-VL-7B-Instruct, Iteration=22026.01 | 69.2 | — | — | — | — | — | |
| DreamPRMFramework Type=Training-Based, Base Model=InternVL-2.5-8B2026.03 | 68.9 | — | — | — | — | — | |
| V-ZeroBackbone=Qwen2.5-VL-7B-Instruct, Iteration=12026.01 | 68.6 | — | — | — | — | — | |
| Qwen2.5-VL-7B-Instruct (Base)Backbone=Qwen2.5-VL-7B-Instruct2026.01 | 68.2 | — | — | — | — | — | |
| Claude 3.5 SonnetZero-shot=true2026.02 | 67.7 | — | — | — | — | — | |
| LLaVA-OneVision-72BModel Scale=72B2024.08 | 67.5 | — | — | — | — | — | |
| ARIA2024.10 | 66.1 | — | — | — | — | — | |
| Pass@1Framework Type=Training-Free, Base Model=Qwen2.5-VL-7B2026.03 | 64.7 | — | — | — | 62.3 | 66.8 | |
| R1-OnevisionFramework Type=Training-Based, Base Model=Qwen2.5-VL-7B2026.03 | 64.1 | — | — | — | 61.7 | 66.2 | |
| Gemini-1.5 Pro2024.10 | 63.9 | — | — | — | — | — | |
| GPT-4o2024.08 | 63.8 | — | — | — | — | — | |
| GPT-4o2024.10 | 63.8 | — | — | — | — | — | |
| LLaVA-OneVision-7BModel Scale=7B2024.08 | 63.2 | — | — | — | — | — | |
| V-ZeroBackbone=Qwen2.5-VL-3B-Instruct, Iteration=12026.01 | 62.6 | — | — | — | — | — | |
| Qwen2.5-VL-3B-Instruct (Base)Backbone=Qwen2.5-VL-3B-Instruct2026.01 | 62.2 | — | — | — | — | — | |
| V-ZeroBackbone=Qwen2.5-VL-3B-Instruct, Iteration=22026.01 | 62 | — | — | — | — | — | |
| OpenAI GPT-4oZero-shot=true2026.02 | 60 | — | — | — | — | — | |
| Gemini-1.5 Flash2024.10 | 58.4 | — | — | — | — | — | |
| Pixtral-12B2024.10 | 58 | — | — | — | — | — | |
| GPT-4o mini2024.10 | 54.7 | — | — | — | — | — | |
| Gemini 1.5 ProZero-shot=true2024.05 | 52.1 | — | — | — | — | — | |
| Idefics2Size=8B, # tokens per image=64, Zero-shot=true2024.05 | 51.6 | — | — | — | — | — | |
| Llama3.2-11B2024.10 | 51.5 | — | — | — | — | — | |
| Idefics2Size=8B, # tokens per image=320, Zero-shot=true2024.05 | 51.4 | — | — | — | — | — | |
| Uni-MuMER-LLAVAArchitecture=LLaVA2025.05 | 51.1 | — | — | — | — | — | |
| GPT-4VLLM=Private, Zero-shot=true2024.03 | 49.9 | — | — | — | — | — | |
| GPT-4VVersion=V-Preview2024.08 | 49.9 | — | — | — | — | — | |
| Qwen2.5-VL-3B-InstructParameters=3B, Mode=Instruct2025.05 | 47.9 | — | — | — | — | — | |
| Claude 3 SonnetZero-shot=true2024.05 | 47.9 | — | — | — | — | — | |
| Uni-MuMER2025.05 | 47.8 | — | — | — | — | — | |
| LLaVA-NeXTLLM=Hermes-2-Yi-34B, Resolution=672, Zero-shot=true2024.03 | 46.5 | — | — | — | — | — | |
| LLaVA-NeXTSize=34B, # tokens per image=2880, Zero-shot=true2024.05 | 46.5 | — | — | — | — | — | |
| Claude 3 HaikuZero-shot=true2024.05 | 46.4 | — | — | — | — | — | |
| Gemini ProLLM=Private, Zero-shot=true2024.03 | 45.2 | — | — | — | — | — | |
| Gemini 1.0 ProZero-shot=true2024.05 | 45.2 | — | — | — | — | — | |
| Mini-Gemini-HDLLM=Hermes-2-Yi-34B, Resolution=672, Zero-shot=true2024.03 | 43.3 | — | — | — | — | — | |
| Qwen-VL-PlusLLM=Private, Zero-shot=true2024.03 | 43.3 | — | — | — | — | — | |
| Mini-Gemini-HDSize=34B, # tokens per image=2880, Zero-shot=true2024.05 | 43.3 | — | — | — | — | — | |
| Mini-Gemini-HDLLM=Mixtral-8x7B, Resolution=672, Zero-shot=true2024.03 | 43.1 | — | — | — | — | — | |
| Mini-GeminiLLM=Mixtral-8x7B, Resolution=336, Zero-shot=true2024.03 | 41.8 | — | — | — | — | — | |
| MM1-ChatSize=30B, # tokens per image=720, Zero-shot=true2024.05 | 39.4 | — | — | — | — | — | |
| Mini-GeminiLLM=Hermes-2-Yi-34B, Resolution=336, Zero-shot=true2024.03 | 38.9 | — | — | — | — | — | |
| Mini-GeminiLLM=Vicuna-13B, Resolution=336, Zero-shot=true2024.03 | 37 | — | — | — | — | — | |
| Mini-Gemini-HDLLM=Vicuna-13B, Resolution=672, Zero-shot=true2024.03 | 37 | — | — | — | — | — | |
| DeepSeek-VLSize=7B, # tokens per image=576, Zero-shot=true2024.05 | 36.1 | — | — | — | — | — | |
| MM1-ChatSize=7B, # tokens per image=720, Zero-shot=true2024.05 | 35.9 | — | — | — | — | — | |
| LLaVA-NeXTLLM=Vicuna-13B, Resolution=672, Zero-shot=true2024.03 | 35.3 | — | — | — | — | — | |
| LLaVA-NeXTSize=13B, # tokens per image=2880, Zero-shot=true2024.05 | 35.3 | — | — | — | — | — | |
| LLaVA-OneVision-0.5BModel Scale=0.5B2024.08 | 34.8 | — | — | — | — | — | |
| LLaVA-NeXTLLM=Vicuna-7B, Resolution=672, Zero-shot=true2024.03 | 34.6 | — | — | — | — | — | |
| CogVLM-ChatLLM=Vicuna-7B, Resolution=490, Zero-shot=true2024.03 | 34.5 | — | — | — | — | — | |
| Mini-Gemini-HDLLM=Vicuna-7B, Resolution=672, Zero-shot=true2024.03 | 32.2 | — | — | — | — | — | |
| Mini-GeminiLLM=Vicuna-7B, Resolution=336, Zero-shot=true2024.03 | 31.4 | — | — | — | — | — | |
| QMoSLoRAModel=InternLM2 + ViT, Initialization=Kaiming uniform, Quantization=4-bit2024.06 | 30.6 | — | — | — | — | — | |
| QLoRAModel=InternLM2 + ViT, Quantization=4-bit2024.06 | 30.2 | — | — | — | — | — | |
| QMoSLoRAModel=InternLM2 + ViT, Initialization=Orthogonal, Quantization=4-bit2024.06 | 30.2 | — | — | — | — | — | |
| Mini-GeminiLLM=Gemma-2B, Resolution=336, Zero-shot=true2024.03 | 29.4 | — | — | — | — | — | |
| LoRAModel=LLaMA-3 + ViT2024.06 | 27.7 | — | — | — | — | — | |
| LLaVA-1.5LLM=Vicuna-13B, Resolution=336, Zero-shot=true2024.03 | 27.6 | — | — | — | — | — | |
| MoSLoRAModel=LLaMA-3 + ViT, Initialization=Orthogonal2024.06 | 27.6 | — | — | — | — | — | |
| MoSLoRAModel=LLaMA-3 + ViT, Initialization=Kaiming uniform2024.06 | 27.5 | — | — | — | — | — | |
| InstructBLIPLLM=Vicuna-7B, Resolution=224, Zero-shot=true2024.03 | 25.3 | — | — | — | — | — | |
| Idefics3-8B-LLaMA3Backbone=Idefics3-8B-LLaMA32026.02 | — | 50.1 | 50.4 | 50.3 | — | — | |
| Intern2.5-VL-4BBackbone=Intern2.5-VL-4B2026.02 | — | 60.4 | 65.1 | 61.6 | — | — | |
| LLaVA-Next-8BBackbone=LLaVA-Next-8B2026.02 | — | 35.8 | 38.6 | 36 | — | — | |
| Qwen2.5-VL-3BBackbone=Qwen2.5-VL-3B2026.02 | — | 52.6 | 61.6 | 50.8 | — | — | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B2026.02 | — | 48.8 | 68.8 | 37.5 | — | — | |
| SNRFBackbone=Qwen2.5-VL-3B2026.02 | — | 55.2 | 57.9 | 55.5 | — | — | |
| SNRFBackbone=Qwen2.5-VL-7B2026.02 | — | 53.3 | 68.1 | 42.1 | — | — | |
| SNRFBackbone=Intern2.5-VL-4B2026.02 | — | 60.6 | 65.9 | 61.3 | — | — | |
| SNRFBackbone=Idefics3-8B-LLaMA32026.02 | — | 50.4 | 49.6 | 51.1 | — | — | |
| SNRFBackbone=LLaVA-Next-8B2026.02 | — | 36.5 | 38.1 | 36.2 | — | — |