Visual Grounding on Out-of-Distribution OOD Avg (test)
78.4Accuracy (OOD Avg)VRRL (Ours)
Evaluation Results
| Method | Links | |
|---|---|---|
| VRRL (Ours)Evaluation Setting=RL, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 78.4 | |
| Multi-SFT -> GRPOEvaluation Setting=RL, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 73.2 | |
| Single-SFT -> GRPOEvaluation Setting=RL, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 70.2 | |
| Reflection TuningEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 55.6 | |
| Multi-SFTEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 49.9 | |
| Single-SFTEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 46.5 | |
| VRRL (Ours)Evaluation Setting=RL, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 45.7 | |
| Multi-SFT -> GRPOEvaluation Setting=RL, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 40 | |
| Single-SFT -> GRPOEvaluation Setting=RL, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 30.1 | |
| Reflection TuningEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 28 | |
| Single-SFTEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 24.5 | |
| Multi-SFTEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 22.5 | |
| VL-Rethinker-32BEvaluation Setting=Zero-shot, Backbone=32B2026.07 | 22.1 | |
| Qwen2.5-VL-7BSingleEvaluation Setting=Zero-shot, Backbone=7B, Strategy=Single-turn2026.07 | 8.8 | |
| Qwen2.5-VL-7B*MultiEvaluation Setting=Zero-shot, Backbone=7B, Strategy=Multi-turn reflection2026.07 | 8.8 | |
| Qwen2.5-VL-3BSingleEvaluation Setting=Zero-shot, Backbone=3B, Strategy=Single-turn2026.07 | 6 | |
| VL-Rethinker-7BEvaluation Setting=Zero-shot, Backbone=7B2026.07 | 4.6 | |
| Qwen2.5-VL-3B*MultiEvaluation Setting=Zero-shot, Backbone=3B, Strategy=Multi-turn reflection2026.07 | 4.5 |