Visual Grounding on Out-of-Distribution Large Table (test)
91.4AccuracyMulti-SFT -> GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Multi-SFT -> GRPOEvaluation Setting=RL, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 91.4 | — | |
| Single-SFT -> GRPOEvaluation Setting=RL, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 89.6 | — | |
| VRRL (Ours)Evaluation Setting=RL, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 89.6 | — | |
| VRRL (Ours)Evaluation Setting=RL, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 88.6 | — | |
| Multi-SFT -> GRPOEvaluation Setting=RL, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 78.6 | — | |
| Reflection TuningEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 75.1 | — | |
| Multi-SFTEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 66.2 | — | |
| Single-SFTEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-7B-Instruct2026.07 | 62.8 | — | |
| Single-SFT -> GRPOEvaluation Setting=RL, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 53.3 | — | |
| Reflection TuningEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 52.5 | — | |
| Multi-SFTEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 50.4 | — | |
| Single-SFTEvaluation Setting=SFT, Model Backbone=Qwen2.5-VL-3B-Instruct2026.07 | 46.1 | — | |
| VL-Rethinker-32BEvaluation Setting=Zero-shot, Backbone=32B2026.07 | 18.7 | — | |
| Qwen2.5-VL-7BSingleEvaluation Setting=Zero-shot, Backbone=7B, Strategy=Single-turn2026.07 | 9.7 | — | |
| Qwen2.5-VL-7B*MultiEvaluation Setting=Zero-shot, Backbone=7B, Strategy=Multi-turn reflection2026.07 | 8.9 | 49.3 | |
| VL-Rethinker-7BEvaluation Setting=Zero-shot, Backbone=7B2026.07 | 7.9 | — | |
| Qwen2.5-VL-3BSingleEvaluation Setting=Zero-shot, Backbone=3B, Strategy=Single-turn2026.07 | 4.8 | — | |
| Qwen2.5-VL-3B*MultiEvaluation Setting=Zero-shot, Backbone=3B, Strategy=Multi-turn reflection2026.07 | 2.2 | 69.2 |