Visual Grounding on Out-of-Distribution Scatter Plot (test)
89.7AccuracyVRRL (Ours)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VRRL (Ours)Evaluation Setting=RL, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 89.7 | — | |
| Multi-SFT -> GRPOEvaluation Setting=RL, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 86 | — | |
| Single-SFT -> GRPOEvaluation Setting=RL, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 84.3 | — | |
| Reflection TuningEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 81.3 | — | |
| Multi-SFTEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 73.3 | — | |
| Single-SFTEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 68.9 | — | |
| VRRL (Ours)Evaluation Setting=RL, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 40.3 | — | |
| Multi-SFT -> GRPOEvaluation Setting=RL, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 37.2 | — | |
| Single-SFT -> GRPOEvaluation Setting=RL, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 34.7 | — | |
| VL-Rethinker-32BEvaluation Setting=Zero-shot, Backbone=32B2026.07 | 32.7 | — | |
| Reflection TuningEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 27.4 | — | |
| Multi-SFTEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 24.8 | — | |
| Single-SFTEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 23.8 | — | |
| Qwen2.5-VL-7B*MultiEvaluation Setting=Zero-shot, Backbone=7B, Strategy=Multi-turn reflection2026.07 | 4.6 | 38.2 | |
| Qwen2.5-VL-7BSingleEvaluation Setting=Zero-shot, Backbone=7B, Strategy=Single-turn2026.07 | 4.5 | — | |
| VL-Rethinker-7BEvaluation Setting=Zero-shot, Backbone=7B2026.07 | 3.7 | — | |
| Qwen2.5-VL-3BSingleEvaluation Setting=Zero-shot, Backbone=3B, Strategy=Single-turn2026.07 | 2.9 | — | |
| Qwen2.5-VL-3B*MultiEvaluation Setting=Zero-shot, Backbone=3B, Strategy=Multi-turn reflection2026.07 | 2.4 | 75.5 |