Vision-Language Perception on VL Perception Benchmarks TextVQA, POPE, Seed-Bench
85.5TextVQA ScoreBase
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| BaseBase Model=Qwen2.5-VL-7B-Instruct, Reasoning Model=DeepSeek-R1-Distill-Qwen-7B2026.01 | 85.5 | 86.4 | 77 | 82.9 | |
| FRISMBase Model=Qwen2.5-VL-7B-Instruct, Reasoning Model=DeepSeek-R1-Distill-Qwen-7B2026.01 | 85 | 87.1 | 76.9 | 83 | |
| DAREBase Model=Qwen2.5-VL-7B-Instruct, Reasoning Model=DeepSeek-R1-Distill-Qwen-7B2026.01 | 84.9 | 85.6 | 76.9 | 82.5 | |
| TABase Model=Qwen2.5-VL-7B-Instruct, Reasoning Model=DeepSeek-R1-Distill-Qwen-7B, Lambda (λ)=0.12026.01 | 83.9 | 86.8 | 76.5 | 82.4 | |
| IP-MergingBase Model=Qwen2.5-VL-7B-Instruct, Reasoning Model=DeepSeek-R1-Distill-Qwen-7B, Temperature (T)=0.42026.01 | 82.9 | 87.1 | 76.9 | 82.3 | |
| IP-MergingBase Model=Qwen2.5-VL-7B-Instruct, Reasoning Model=DeepSeek-R1-Distill-Qwen-7B, Temperature (T)=0.32026.01 | 82 | 86.4 | 77 | 81.8 | |
| IP-MergingBase Model=Qwen2.5-VL-7B-Instruct, Reasoning Model=DeepSeek-R1-Distill-Qwen-7B, Temperature (T)=0.22026.01 | 81.6 | 84.9 | 77 | 81.2 | |
| TABase Model=Qwen2.5-VL-32B-Instruct, Reasoning Model=QwQ-32B2026.01 | 79.9 | 86.5 | 68.3 | 78.2 | |
| FRISMBase Model=Qwen2.5-VL-32B-Instruct, Reasoning Model=QwQ-32B2026.01 | 79.9 | 87 | 67.9 | 78.3 | |
| BaseBase Model=Qwen2.5-VL-32B-Instruct, Reasoning Model=QwQ-32B2026.01 | 79.8 | 86.5 | 69.6 | 78.6 | |
| BaseBase Model=Qwen2.5-VL-3B-Instruct, Reasoning Model=SmallThinker-3B2026.01 | 79.3 | 86.2 | 73.7 | 79.7 | |
| TABase Model=Qwen2.5-VL-3B-Instruct, Reasoning Model=SmallThinker-3B, Lambda (λ)=0.12026.01 | 79.2 | 86.3 | 73.8 | 79.8 | |
| DAREBase Model=Qwen2.5-VL-3B-Instruct, Reasoning Model=SmallThinker-3B2026.01 | 79.2 | 86.2 | 73.8 | 79.7 | |
| FRISMBase Model=Qwen2.5-VL-3B-Instruct, Reasoning Model=SmallThinker-3B2026.01 | 79.2 | 86.2 | 73.8 | 79.7 | |
| TABase Model=Qwen2.5-VL-3B-Instruct, Reasoning Model=SmallThinker-3B, Lambda (λ)=0.152026.01 | 79.1 | 86.6 | 73.7 | 79.8 | |
| TABase Model=Qwen2.5-VL-3B-Instruct, Reasoning Model=SmallThinker-3B, Lambda (λ)=0.22026.01 | 79 | 86.6 | 73.8 | 79.8 | |
| Ties-MergingBase Model=Qwen2.5-VL-32B-Instruct, Reasoning Model=QwQ-32B2026.01 | 78.3 | 86.3 | 58.6 | 74.4 | |
| Ties-MergingBase Model=Qwen2.5-VL-7B-Instruct, Reasoning Model=DeepSeek-R1-Distill-Qwen-7B2026.01 | 77.9 | 84.2 | 74.6 | 78.9 | |
| IP-MergingBase Model=Qwen2.5-VL-3B-Instruct, Reasoning Model=SmallThinker-3B, Temperature (T)=0.32026.01 | 76.9 | 81.1 | 72.9 | 77 | |
| IP-MergingBase Model=Qwen2.5-VL-3B-Instruct, Reasoning Model=SmallThinker-3B, Temperature (T)=0.42026.01 | 76.9 | 81.1 | 72.9 | 77 | |
| Ties-MergingBase Model=Qwen2.5-VL-3B-Instruct, Reasoning Model=SmallThinker-3B2026.01 | 76.4 | 86.5 | 73.6 | 77 | |
| IP-MergingBase Model=Qwen2.5-VL-32B-Instruct, Reasoning Model=QwQ-32B2026.01 | 75.8 | 87.9 | 67.4 | 77.1 | |
| IP-MergingBase Model=Qwen2.5-VL-3B-Instruct, Reasoning Model=SmallThinker-3B, Temperature (T)=0.22026.01 | 70.6 | 88.2 | 72.7 | 77.2 | |
| TABase Model=Qwen2.5-VL-7B-Instruct, Reasoning Model=DeepSeek-R1-Distill-Qwen-7B, Lambda (λ)=0.152026.01 | 69.1 | 73.9 | 63.9 | 69 | |
| TABase Model=Qwen2.5-VL-7B-Instruct, Reasoning Model=DeepSeek-R1-Distill-Qwen-7B, Lambda (λ)=0.22026.01 | 68 | 73.4 | 61 | 67.5 |