Pointing-based visual grounding on EgoPoint CoT (test)
93.98P@0.3Human Study
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Human StudyTraining Paradigm=Upper Bound, Backbone=-2026.06 | 93.98 | 88.5 | 82.18 | 82.65 | |
| PointVG-R (Qwen2.5)Training Paradigm=V-CoT + RL, Backbone=7B2026.06 | 88.05 | 83.6 | 74.52 | 75.7 | |
| Qwen2.5-VLTraining Paradigm=Visual Chain-of-Thought (SFT-CoT), Backbone=7B2026.06 | 80.25 | 69.35 | 54.49 | 64.53 | |
| Qwen3-VLTraining Paradigm=Visual Chain-of-Thought (SFT-CoT), Backbone=8B2026.06 | 73.47 | 70.21 | 64.38 | 66.88 | |
| LLaVA-v1.5Training Paradigm=Fine-tuned Baselines (Non Thinking SFT), Backbone=13B2026.06 | 69.78 | 59.13 | 36.18 | 51.65 | |
| LLaVA-v1.5Training Paradigm=Visual Chain-of-Thought (SFT-CoT), Backbone=13B2026.06 | 69.34 | 57.78 | 35.17 | 52.25 | |
| Qwen2.5-VLTraining Paradigm=Fine-tuned Baselines (Non Thinking SFT), Backbone=7B2026.06 | 68.73 | 63.62 | 56.74 | 59.84 | |
| InternVL-3.5Training Paradigm=Fine-tuned Baselines (Non Thinking SFT), Backbone=8B2026.06 | 68.02 | 63.19 | 55.06 | 58.67 | |
| Qwen3-VLTraining Paradigm=Fine-tuned Baselines (Non Thinking SFT), Backbone=8B2026.06 | 62.66 | 59.32 | 53.87 | 57.34 | |
| InternVL-3.5Training Paradigm=Visual Chain-of-Thought (SFT-CoT), Backbone=8B2026.06 | 60.89 | 56.5 | 49.47 | 51.68 | |
| Qwen2.5-VLTraining Paradigm=Zero-shot Methods, Backbone=7B2026.06 | 54.21 | 49.76 | 42.93 | 45.49 | |
| LLaVA-OneVisionTraining Paradigm=Zero-shot Methods, Backbone=8B2026.06 | 52.58 | 39.87 | 25.62 | 42.34 | |
| Qwen3-VLTraining Paradigm=Zero-shot Methods, Backbone=8B2026.06 | 48.14 | 44.46 | 38.96 | 42.98 | |
| InternVL-v3.5Training Paradigm=Zero-shot Methods, Backbone=8B2026.06 | 47.9 | 42.64 | 34.66 | 39.89 | |
| DeepSeek-VL2-SmallTraining Paradigm=Zero-shot Methods, Backbone=-2026.06 | 40.77 | 37.38 | 33.51 | 36.19 | |
| DeepSeek-OCRTraining Paradigm=Zero-shot Methods, Backbone=-2026.06 | 38.53 | 32.07 | 27.34 | 33.67 | |
| LLaVA-v1.5Training Paradigm=Zero-shot Methods, Backbone=13B2026.06 | 38.1 | 27.15 | 11.38 | 26.42 | |
| Ferret-v1Training Paradigm=Zero-shot Methods, Backbone=7B2026.06 | 34.89 | 29.54 | 24.28 | 29.56 | |
| Ferret-v1Training Paradigm=Zero-shot Methods, Backbone=13B2026.06 | 30.59 | 24.71 | 19.98 | 26.34 | |
| Florence2-largeTraining Paradigm=Zero-shot Methods, Backbone=-2026.06 | 10.79 | 8.69 | 7.91 | 10.86 |