2D Computer Vision Benchmarking on CVBench2D
72.88AccuracyMix
Evaluation Results
| Method | Links | |
|---|---|---|
| MixPrompting=CoT prompting, Backbone=Qwen-VL-2.5 3B2025.12 | 72.88 | |
| JigsawPrompting=CoT prompting, Backbone=Qwen-VL-2.5 3B2025.12 | 71.33 | |
| Jigsaw-R1Prompting=CoT prompting, Backbone=Qwen-VL-2.5 3B2025.12 | 70.87 | |
| VLM-R1Prompting=CoT prompting, Backbone=Qwen-VL-2.5 3B2025.12 | 66.65 | |
| Qwen 2.5 VLPrompting=CoT prompting, Backbone=Qwen-VL-2.5 3B2025.12 | 65.62 | |
| JARVISLLM=Qwen2-7B2025.12 | 63.9 | |
| Ours w/o MaskingLLM=Qwen2-7B2025.12 | 62.8 | |
| LLaVALLM=Qwen2-7B2025.12 | 62.5 | |
| VIRALLLM=Qwen2-7B2025.12 | 62 | |
| JARVISLLM=Vicuna-7B2025.12 | 60.4 | |
| Ours w/o MaskingLLM=Vicuna-7B2025.12 | 57.7 | |
| LLaVALLM=Vicuna-7B2025.12 | 57.6 | |
| VIRALLLM=Vicuna-7B2025.12 | 55.7 |