Open-ended Visual Understanding on LLaVA-Bench In-the-Wild (test)
34.3ROUGE-LCSMR
Evaluation Results
| Method | Links | |
|---|---|---|
| CSMRPerception Backbone=Qwen2-VL-7B, Reasoning Backbone=Qwen2-7B, Zero-shot=true2026.05 | 34.3 | |
| ICoTPerception Backbone=Qwen2-VL-7B, Reasoning Backbone=Qwen2-VL-7B, Zero-shot=true2026.05 | 34.2 | |
| No-CoTPerception Backbone=Qwen2-VL-7B, Reasoning Backbone=Qwen2-VL-7B, Zero-shot=true2026.05 | 32.7 | |
| SCAFFOLDPerception Backbone=Qwen2-VL-7B, Reasoning Backbone=Qwen2-VL-7B, Zero-shot=true2026.05 | 31.8 | |
| Multimodal CoTPerception Backbone=Qwen2-VL-7B, Reasoning Backbone=Qwen2-VL-7B, Zero-shot=true2026.05 | 30.7 | |
| CCoTPerception Backbone=Qwen2-VL-7B, Reasoning Backbone=Qwen2-VL-7B, Zero-shot=true2026.05 | 29.4 | |
| CaptionPerception Backbone=Qwen2-VL-7B, Reasoning Backbone=Qwen2-7B, Zero-shot=true2026.05 | 29.1 | |
| DDCoTPerception Backbone=Qwen2-VL-7B, Reasoning Backbone=Qwen2-7B, Zero-shot=true2026.05 | 26.4 |