Referring-expression grounding on RefCOCOg Avg
89.8Accuracy@0.5Visual Para-Thinker++ (3B)
Evaluation Results
| Method | Links | |
|---|---|---|
| Visual Para-Thinker++ (3B)Backbone=Qwen2.5-VL-3B2026.06 | 89.8 | |
| Visual Para-Thinker (3B)Backbone=Qwen2.5-VL-3B2026.06 | 87.1 | |
| SequentialBackbone=Qwen2.5-VL-3B2026.06 | 85 | |
| Qwen2.5-VL-3BBackbone=Qwen2.5-VL-3B2026.06 | 83.9 |