Short-answer Visual Question Answering on SEEDBench2+
68.7AccuracyLLaDA-V
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaDA-VModel Category=Diffusion Vision-Language Models2026.04 | 68.7 | |
| Qwen2.5-VL-3BModel Category=Autoregressive Vision-Language Models2026.04 | 68.6 | |
| Fast-dVLMModel Category=Diffusion Vision-Language Models, Decoding Strategy=masked diffusion model decoding (MDM)2026.04 | 67.2 | |
| Fast-dVLMModel Category=Diffusion Vision-Language Models, Decoding Strategy=speculative decoding (spec.)2026.04 | 67.2 | |
| Intern-VL-2.5-4BModel Category=Autoregressive Vision-Language Models2026.04 | 67 | |
| LaViDaModel Category=Diffusion Vision-Language Models2026.04 | 57.7 | |
| MiniCPM-V-2 (3B)Model Category=Autoregressive Vision-Language Models2026.04 | 52.5 | |
| DimpleModel Category=Diffusion Vision-Language Models2026.04 | 51.7 | |
| VILA-1.5-3BModel Category=Autoregressive Vision-Language Models2026.04 | 41.2 |