Visual Perception on AI2D
84AccuracyINTERNVL3-8B + PGT
Evaluation Results
| Method | Links | |
|---|---|---|
| INTERNVL3-8B + PGTBackbone=INTERNVL3-8B, Data=PGT-augmented2026.05 | 84 | |
| INTERNVL3-8BBackbone=INTERNVL3-8B2026.05 | 83.8 | |
| THINKLITE-VLMethod=THINKLITE-VL2026.05 | 83.4 | |
| QWEN2.5-VL-7B + PGTBackbone=QWEN2.5-VL-7B, Data=PGT-augmented2026.05 | 83.2 | |
| Qwen2-VLSize=7B2026.03 | 83 | |
| IMAGE JIGSAWMethod=IMAGE JIGSAW2026.05 | 82.9 | |
| QWEN2.5-VL-7BBackbone=QWEN2.5-VL-7B2026.05 | 82.7 | |
| QWEN2.5-VL-7B + SPECIALIZED MIXBackbone=QWEN2.5-VL-7B, Data=Specialized Mix2026.05 | 82.7 | |
| Ovis1.5-LLaMA3Size=8B2026.03 | 82.5 | |
| Qwen2.5-VLSize=7B2026.03 | 82.4 | |
| MiniCPM-V-2.6Size=7B2026.03 | 82.1 | |
| Insight-V++Size=7B, Base Model=Qwen2.5-VL, Self-Evolving=true2026.03 | 81.7 | |
| Qwen2.5-VL + Multi-Agent (RL)Size=7B, Multi-Agent (RL)=true2026.03 | 81.4 | |
| InternLM-XComposer2Size=7B2026.03 | 81.2 | |
| POINTSSize=7B2026.03 | 81.2 | |
| Our Base Model + Multi-AgentSize=7B, Multi-Agent=true2026.03 | 80.1 | |
| Insight-VSize=7B, Base Model=Our Base Model, Iterative DPO=true2026.03 | 79.8 | |
| Our Base ModelSize=7B2026.03 | 79.7 | |
| QWEN2.5-VL-3B + SPECIALIZED MIXBackbone=QWEN2.5-VL-3B, Data=Specialized Mix2026.05 | 79.6 | |
| QWEN2.5-VL-3BBackbone=QWEN2.5-VL-3B2026.05 | 79.2 | |
| DPA-Qwen3-32BTarget LLM=Qwen3-32B2026.05 | 79 | |
| MiniCPM-LLaMA3-V 2.5Size=8B2026.03 | 78.4 | |
| QWEN2.5-VL-3B + PGTBackbone=QWEN2.5-VL-3B, Data=PGT-augmented2026.05 | 78.1 | |
| Insight-V-LLaVASize=8B, Base Model=LLaVA-NeXT-LLaMA3, Iterative DPO=true2026.03 | 77.3 | |
| Idefics3-LLaMA3Size=8B2026.03 | 76.5 | |
| LLaVA-NeXT-LLaMA3 + Multi-AgentSize=8B, Multi-Agent=true2026.03 | 75.7 | |
| Qwen2-VL-2BTarget LLM=Public Models2026.05 | 74.7 | |
| Cambrian-1Size=8B2026.03 | 74.6 | |
| Cambrian-1-8BTarget LLM=Public Models2026.05 | 74.6 | |
| SPATIAL-LADDER-3BMethod=SPATIAL-LADDER-3B2026.05 | 73.5 | |
| LLaVA-NeXT-Qwen3-32BTarget LLM=Qwen3-32B2026.05 | 73 | |
| Idefics2-8BTarget LLM=Public Models2026.05 | 72.5 | |
| LLaVA-NeXT-LLaMA3Size=8B2026.03 | 71.5 | |
| LLAVA-NEXT-LLAMA3-8BBackbone=LLAVA-NEXT-LLAMA3-8B2026.05 | 71.5 | |
| LLAVA-NEXT-LLAMA3-8B + PGTBackbone=LLAVA-NEXT-LLAMA3-8B, Data=PGT-augmented2026.05 | 71.3 | |
| VIGORL-3BMethod=VIGORL-3B2026.05 | 71.2 | |
| DPA-Qwen3-4BTarget LLM=Qwen3-4B2026.05 | 70 | |
| Bunny-LLaMA3Size=8B2026.03 | 69.4 | |
| LLaVA-NeXT-Qwen3-4BTarget LLM=Qwen3-4B2026.05 | 67.4 | |
| LLaVA-NeXT-7BTarget LLM=Public Models2026.05 | 66.6 | |
| DeepSeek-VLSize=7B2026.03 | 65.3 | |
| LLAVA-NEXT-7BBackbone=LLAVA-NEXT-7B2026.05 | 64.5 | |
| LLAVA-NEXT-7B + PGTBackbone=LLAVA-NEXT-7B, Data=PGT-augmented2026.05 | 64.5 | |
| DPA-LLaMA-3.2-3BTarget LLM=LLaMA-3.2-3B2026.05 | 59.5 | |
| LLaVA-NeXT-LLaMA-3.2-3BTarget LLM=LLaMA-3.2-3B2026.05 | 59 | |
| VILA-1.5Size=8B2026.03 | 58.8 | |
| LLaVA-1.5-7BTarget LLM=Public Models2026.05 | 52.8 |