Visual Grounding on In-Distribution (test)
99.7AccuracyVRRL (Ours)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VRRL (Ours)Evaluation Setting=RL, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 99.7 | — | |
| Multi-SFT -> GRPOEvaluation Setting=RL, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 99.6 | — | |
| VRRL (Ours)Evaluation Setting=RL, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 99.6 | — | |
| Single-SFT -> GRPOEvaluation Setting=RL, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 99.6 | — | |
| Multi-SFT -> GRPOEvaluation Setting=RL, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 99.6 | — | |
| Single-SFT -> GRPOEvaluation Setting=RL, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 96.2 | — | |
| Reflection TuningEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 95.3 | — | |
| Reflection TuningEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 92.7 | — | |
| Multi-SFTEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 84.8 | — | |
| Multi-SFTEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 84.7 | — | |
| Single-SFTEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 83.6 | — | |
| Single-SFTEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 80.4 | — | |
| VL-Rethinker-32BEvaluation Setting=Zero-shot, Backbone=32B2026.07 | 42.4 | — | |
| Qwen2.5-VL-7B*MultiEvaluation Setting=Zero-shot, Backbone=7B, Strategy=Multi-turn reflection2026.07 | 19.8 | 58 | |
| Qwen2.5-VL-7BSingleEvaluation Setting=Zero-shot, Backbone=7B, Strategy=Single-turn2026.07 | 17.9 | — | |
| VL-Rethinker-7BEvaluation Setting=Zero-shot, Backbone=7B2026.07 | 15.1 | — | |
| Qwen2.5-VL-3B*MultiEvaluation Setting=Zero-shot, Backbone=3B, Strategy=Multi-turn reflection2026.07 | 5.6 | 77.3 | |
| Qwen2.5-VL-3BSingleEvaluation Setting=Zero-shot, Backbone=3B, Strategy=Single-turn2026.07 | 5.3 | — |