Short-answer Visual Question Answering on TextVQA (Accuracy)
79.3AccuracyFast-dVLM
Evaluation Results
| Method | Links | |
|---|---|---|
| Fast-dVLMModel Category=Diffusion Vision-Language Models, Decoding Strategy=speculative decoding (spec.)2026.04 | 79.3 | |
| Qwen2.5-VL-3BModel Category=Autoregressive Vision-Language Models2026.04 | 79.1 | |
| Intern-VL-2.5-4BModel Category=Autoregressive Vision-Language Models2026.04 | 78.8 | |
| Fast-dVLMModel Category=Diffusion Vision-Language Models, Decoding Strategy=masked diffusion model decoding (MDM)2026.04 | 76.1 | |
| MiniCPM-V-2 (3B)Model Category=Autoregressive Vision-Language Models2026.04 | 74.4 | |
| LLaDA-VModel Category=Diffusion Vision-Language Models2026.04 | 64.7 | |
| DimpleModel Category=Diffusion Vision-Language Models2026.04 | 61.6 | |
| LaViDaModel Category=Diffusion Vision-Language Models2026.04 | 60.3 | |
| VILA-1.5-3BModel Category=Autoregressive Vision-Language Models2026.04 | 58.2 |