Visual Math Reasoning on MathVista (test)
80MathVista AccuracyQwen3-VL-8B-Instruct + DUPL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3-VL-8B-Instruct + DUPLModel Size=8B, Optimization=DUPL2025.10 | 80 | — | — | |
| Qwen3-VL-8B-Instruct + GRPOModel Size=8B, Optimization=GRPO2025.10 | 78.9 | — | — | |
| Qwen3-VL-4B-Instruct + DUPLModel Size=4B, Optimization=DUPL2025.10 | 78.4 | — | — | |
| Qwen3-VL-4B-Instruct + GRPOModel Size=4B, Optimization=GRPO2025.10 | 78.2 | — | — | |
| Qwen3-VL-8B-InstructModel Size=8B2025.10 | 76.8 | — | — | |
| Qwen3-VL-4B-InstructModel Size=4B2025.10 | 75.5 | — | — | |
| Uni-CoT2025.08 | 73.3 | — | — | |
| BAGEL2025.08 | 73.1 | — | — | |
| Qwen2.5-VL-7BParameters=7B2025.08 | 68.2 | — | — | |
| LaViDa-OCaching strategy=Vanilla sampling, Generation length (L)=1024 tokens, Block size (S)=322025.12 | 56.9 | 10.41 | 1 | |
| Sparse-LaViDaCaching strategy=Learned truncation strategy, Generation length (L)=1024 tokens, Block size (S)=322025.12 | 56.7 | 3.72 | 2.8 | |
| LaViDa-O+Fast-dLLMCaching strategy=Training-free KV-caching baseline, Generation length (L)=1024 tokens, Block size (S)=322025.12 | 56.1 | 5.57 | 1.87 | |
| InternVL2.5-2BParameters=2B2025.08 | 51.3 | — | — | |
| GPT-4V2025.08 | 47.5 | — | — |