Visual Reasoning on Vision-Centric Benchmarks
59.1BLINK ScoreViThinker
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| ViThinkerModel Type=Visual Reasoning Method, Backbone=Qwen2.5-VL-7B, Training Data=ViThinker training data, Tuning Method=LoRA2026.02 | 59.1 | 81.4 | 74.2 | 61.3 | 71.5 | 76.2 | 72.5 | 70.9 | — | — | |
| ICoTModel Type=Visual Reasoning Method, Backbone=Qwen2.5-VL-7B, Training=Training-free2026.02 | 57.8 | 76.7 | 70.3 | 58.8 | 68.5 | 71.2 | 67.4 | 67.2 | — | — | |
| AuroraModel Type=Visual Reasoning Method, Backbone=Qwen2.5-VL-7B, Training Data=ViThinker training data2026.02 | 57.5 | 77 | 70 | 58.5 | 68.8 | 71.5 | 67.5 | 67.3 | — | — | |
| MINT-CoTModel Type=Visual Reasoning Method, Backbone=Qwen2.5-VL-7B, Training Data=ViThinker training data2026.02 | 57.3 | 78.3 | 72.5 | 60.1 | 70.2 | 73.8 | 70.2 | 68.9 | — | — | |
| CoVTModel Type=Visual Reasoning Method, Backbone=Qwen2.5-VL-7B, Training Data=ViThinker training data2026.02 | 56 | 80 | 71.6 | 58.7 | 69.2 | 72.9 | 69.4 | 68.3 | — | — | |
| Qwen2.5-VL-7BModel Type=Standard Baseline (Backbone), Backbone=Qwen2.5-VL-7B2026.02 | 55.7 | 74.5 | 68.6 | 56 | 67.1 | 68.6 | 64.9 | 65.1 | — | — | |
| Visual CoTModel Type=Visual Reasoning Method, Backbone=Qwen2.5-VL-7B, Training Data=ViThinker training data2026.02 | 53.5 | 76.8 | 70.1 | 54.2 | 66.8 | 70.5 | 66.3 | 65.5 | — | — | |
| LLaVALLM=Qwen2-7B, Visual Encoder=CLIP ViT-L2025.12 | 52.7 | — | 58 | 36.7 | — | — | — | 55.3 | 62.5 | 66.8 | |
| Qwen2.5-VL-7B + Textual CoT ReasoningModel Type=Standard Baseline (Backbone), Backbone=Qwen2.5-VL-7B, Reasoning Mode=Textual CoT2026.02 | 51.8 | 71.2 | 68.9 | 51.5 | 63.5 | 64.9 | 61.2 | 61.9 | — | — | |
| JARVISLLM=Qwen2-7B, Visual Encoder=SigLIP2 ViT-L2025.12 | 50 | — | 59.6 | 53.1 | — | — | — | 59.4 | 67.4 | 66.8 | |
| JARVISLLM=Qwen2-7B, Visual Encoder=CLIP ViT-L2025.12 | 49.3 | — | 55.8 | 38 | — | — | — | 56 | 63.9 | 73 | |
| JARVISLLM=Ministral-8B, Visual Encoder=CLIP ViT-L2025.12 | 49.2 | — | 58.6 | 34.7 | — | — | — | 53.1 | 57.6 | 65.5 | |
| JARVISLLM=Vicuna-7B, Visual Encoder=CLIP ViT-L2025.12 | 48.3 | — | 55.6 | 30.7 | — | — | — | 51.7 | 60.4 | 63.8 | |
| LLaVALLM=Qwen2-7B, Visual Encoder=SigLIP2 ViT-L2025.12 | 48 | — | 57.5 | 48.5 | — | — | — | 57.6 | 65.8 | 68.1 | |
| LLaVALLM=Vicuna-7B, Visual Encoder=CLIP ViT-L2025.12 | 46.8 | — | 54.9 | 31.3 | — | — | — | 50.9 | 57.6 | 63.7 | |
| LLaVALLM=Ministral-8B, Visual Encoder=CLIP ViT-L2025.12 | 44.8 | — | 59.2 | 30 | — | — | — | 51.5 | 61.4 | 62.1 | |
| LLaVALLM=LLaMA-3.2-3B, Visual Encoder=CLIP ViT-L2025.12 | 32 | — | 56.3 | 46.4 | — | — | — | 52.1 | 63.7 | 62.3 | |
| JARVISLLM=LLaMA-3.2-3B, Visual Encoder=CLIP ViT-L2025.12 | 32 | — | 58.7 | 49.2 | — | — | — | 53.5 | 63.6 | 64.1 | |
| JARVISLLM=Gemma2-2B, Visual Encoder=CLIP ViT-L2025.12 | 31.3 | — | 54.2 | 45.3 | — | — | — | 50.8 | 57.3 | 65.7 | |
| LLaVALLM=Gemma2-2B, Visual Encoder=CLIP ViT-L2025.12 | 30.7 | — | 53.3 | 44.3 | — | — | — | 50 | 57.3 | 64.7 |