Visual Grounding on Cell Query Out-of-Distribution (test)
77.3AccuracyVRRL (Ours)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VRRL (Ours)Evaluation Setting=RL, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 77.3 | — | |
| Multi-SFT -> GRPOEvaluation Setting=RL, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 68.4 | — | |
| Single-SFT -> GRPOEvaluation Setting=RL, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 68.3 | — | |
| Reflection TuningEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 51.8 | — | |
| Multi-SFTEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 39.1 | — | |
| Single-SFTEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 34 | — | |
| VL-Rethinker-32BEvaluation Setting=Zero-shot, Backbone=32B2026.07 | 27.6 | — | |
| VRRL (Ours)Evaluation Setting=RL, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 20.3 | — | |
| Multi-SFT -> GRPOEvaluation Setting=RL, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 13.5 | — | |
| Qwen2.5-VL-7B*MultiEvaluation Setting=Zero-shot, Backbone=7B, Strategy=Multi-turn reflection2026.07 | 7.2 | 76.8 | |
| Reflection TuningEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 7 | — | |
| Qwen2.5-VL-7BSingleEvaluation Setting=Zero-shot, Backbone=7B, Strategy=Single-turn2026.07 | 6.1 | — | |
| VL-Rethinker-7BEvaluation Setting=Zero-shot, Backbone=7B2026.07 | 5.7 | — | |
| Single-SFT -> GRPOEvaluation Setting=RL, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 5.3 | — | |
| Qwen2.5-VL-3BSingleEvaluation Setting=Zero-shot, Backbone=3B, Strategy=Single-turn2026.07 | 3.4 | — | |
| Single-SFTEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 2.4 | — | |
| Multi-SFTEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 1.6 | — | |
| Qwen2.5-VL-3B*MultiEvaluation Setting=Zero-shot, Backbone=3B, Strategy=Multi-turn reflection2026.07 | 1.3 | 86.1 |