General Visual Understanding on RealWorldQA
71.3AccuracyDAPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DAPOBackbone=Qwen3-VL-8B-Instruct2026.05 | 71.3 | — | |
| GRPOBackbone=Qwen3-VL-8B-Instruct2026.05 | 71.2 | — | |
| PDCRBackbone=Qwen3-VL-8B-Instruct2026.05 | 70.7 | — | |
| PACRBackbone=Qwen3-VL-8B-Instruct2026.05 | 70.6 | — | |
| DCRL2026.06 | 70.5 | — | |
| Zero-shot InferenceBackbone=Qwen3-VL-8B-Instruct2026.05 | 70.1 | — | |
| Qwen3-VL-8BModel Size=8B2026.06 | 69.5 | — | |
| Percention-R1 (7B)Backbone=7B2025.08 | 69.4 | 45.2 | |
| Perception-R1Backbone=Perception-R1 (7B)2026.05 | 69.4 | — | |
| Vision-SR1Backbone=Qwen2.5-VL-7B2025.08 | 69.2 | 52.2 | |
| Zero-shot InferenceBackbone=Qwen2.5-VL-7B, Inference Protocol=Zero-shot (before RL)2025.08 | 68.5 | 41.5 | |
| Zero-shot InferenceBackbone=Mimo-VL-7B, Inference Protocol=Zero-shot (before RL)2025.08 | 68.2 | 44.4 | |
| Vision-SR1Backbone=Mimo-VL-7B2025.08 | 68.1 | 49.5 | |
| Active-ZeroBackbone=Qwen2.5-VL-7B-Instruct2026.02 | 67.58 | — | |
| PDCRBackbone=Qwen2.5-VL-7B2026.05 | 67.3 | — | |
| Vision-R1Backbone=Mimo-VL-7B, Training Data=47K data2025.08 | 67.1 | 46 | |
| PACRBackbone=Qwen2.5-VL-7B2026.05 | 66.9 | — | |
| Vision-R1Backbone=Qwen2.5-VL-7B, Training Data=47K data2025.08 | 66.6 | 50.7 | |
| VisionZero-CLEVRBackbone=Qwen2.5-VL-7B-Instruct2026.02 | 66.41 | — | |
| DAPOBackbone=Qwen2.5-VL-7B2026.05 | 66.4 | — | |
| Vision-SR1Backbone=Qwen2.5-VL-3B2025.08 | 66.1 | 48.8 | |
| LFM2-VL-1.6B# Total Params=1.6B2025.11 | 65.75 | — | |
| GRPOBackbone=Qwen2.5-VL-7B2026.05 | 65.6 | — | |
| Zero-shot InferenceBackbone=Qwen2.5-VL-7B, Mode=Zero-shot2026.05 | 65.5 | — | |
| Zero-shot InferenceBackbone=Qwen2.5-VL-3B, Inference Protocol=Zero-shot (before RL)2025.08 | 65.4 | 35.5 | |
| VisionZero-RealWorldBackbone=Qwen2.5-VL-7B-Instruct2026.02 | 65.36 | — | |
| VisionZero-ChartBackbone=Qwen2.5-VL-7B-Instruct2026.02 | 64.05 | — | |
| Base ModelBackbone=Qwen2.5-VL-7B-Instruct2026.02 | 63.66 | — | |
| VisPlayBackbone=Qwen2.5-VL-7B-Instruct2026.02 | 63.27 | — | |
| Vision-R1Backbone=Qwen2.5-VL-3B, Training Data=47K data2025.08 | 63 | 47.1 | |
| Base ModelBackbone=Qwen2.5-VL-3B-Instruct2026.02 | 61.7 | — | |
| EvoLMMBackbone=Qwen2.5-VL-7B-Instruct2026.02 | 61.44 | — | |
| Vision-R1 (7B)Backbone=7B2025.08 | 60.1 | 44.5 | |
| Vision-R1Backbone=Vision-R1 (7B)2026.05 | 60.1 | — | |
| Active-ZeroBackbone=Qwen2.5-VL-3B-Instruct2026.02 | 60 | — | |
| VisPlayBackbone=Qwen2.5-VL-3B-Instruct2026.02 | 59.48 | — | |
| PDCRBackbone=Qwen2.5-VL-3B2026.05 | 59.3 | — | |
| SigLIP 2LLM Backbone=Qwen-2.5-7B-Instruct2025.12 | 58.7 | — | |
| PACRBackbone=Qwen2.5-VL-3B2026.05 | 57.6 | — | |
| DAPOBackbone=Qwen2.5-VL-3B2026.05 | 57.5 | — | |
| InternVL3.5-1B# Total Params=1.1B2025.11 | 57.12 | — | |
| Visionary-R1 (3B)Backbone=3B2025.08 | 56.9 | 33.9 | |
| Visionary-R1Backbone=Visionary-R1 (3B)2026.05 | 56.9 | — | |
| Zero-shot InferenceBackbone=Qwen2.5-VL-3B, Mode=Zero-shot2026.05 | 56.7 | — | |
| GRPOBackbone=Qwen2.5-VL-3B2026.05 | 56.6 | — | |
| AIMv2LLM Backbone=Qwen-2.5-7B-Instruct2025.12 | 56.2 | — | |
| DAVELLM Backbone=Llama-3.2-3B-Instruct2025.12 | 55.6 | — | |
| DAVELLM Backbone=Qwen-2.5-7B-Instruct2025.12 | 55.2 | — | |
| SigLIP 2LLM Backbone=Llama-3.2-3B-Instruct2025.12 | 53.5 | — | |
| LFM2-VL-450M# Total Params=0.45B2025.11 | 52.03 | — | |
| AIMv2LLM Backbone=Llama-3.2-3B-Instruct2025.12 | 51.4 | — | |
| SmolVLM2-500M# Total Params=0.5B2025.11 | 51.37 | — | |
| DinoV2LLM Backbone=Llama-3.2-3B-Instruct2025.12 | 49.4 | — | |
| MAE-WebLLM Backbone=Llama-3.2-3B-Instruct2025.12 | 48.6 | — | |
| MAE-WebLLM Backbone=Qwen-2.5-7B-Instruct2025.12 | 45.4 | — | |
| Pix2StructLLM Backbone=Llama-3.2-3B-Instruct2025.12 | 45 | — | |
| DophineLLM Backbone=Qwen-2.5-7B-Instruct2025.12 | 44.6 | — | |
| DophineLLM Backbone=Llama-3.2-3B-Instruct2025.12 | 44.4 | — | |
| DiTLLM Backbone=Llama-3.2-3B-Instruct2025.12 | 43.9 | — | |
| UnicornText-only=true, Pretrain Scale=1.2M2025.03 | 42.35 | — | |
| BunnyText-only=false, Pretrain Scale=1.2M2025.03 | 41.08 | — | |
| Unicorn*Text-only=true, Pretrain Scale=558K2025.03 | 39.83 | — | |
| Pix2structLLM Backbone=Qwen-2.5-7B-Instruct2025.12 | 39.1 | — | |
| LLaVA-1.5Text-only=false, Pretrain Scale=558K2025.03 | 38.73 | — |