Video Reasoning Segmentation on ReVOS Overall
61.3J&F ScoreVeason-R1-7B
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Veason-R1-7BModel size=7B2025.08 | 61.3 | 58.2 | 64.4 | 27 | |
| Veason-R1Backbone=Qwen2.5VL-7B, Protocol=Fully Trained2026.05 | 61.3 | 58.2 | 64.4 | — | |
| RCoT-Seg-3B2026.05 | 61.2 | 58.2 | 64.3 | — | |
| VRS-HQ-13BModel size=13B2025.08 | 60 | 57.6 | 62.5 | 18.9 | |
| VRS-HQ-13BVenue=CVPR20252026.05 | 60 | 57.6 | 62.5 | — | |
| Veason-R1-3BModel size=3B2025.08 | 59.9 | 56.9 | 62.8 | 28.5 | |
| Veason-R1-3BVenue=CVPR20262026.05 | 59.9 | 56.9 | 62.8 | — | |
| VRS-HQ-7BModel size=7B2025.08 | 59.1 | 56.6 | 61.6 | 19.7 | |
| VRS-HQ-7BVenue=CVPR20252026.05 | 59.1 | 56.6 | 61.6 | — | |
| VRS-HQBackbone=ChatUniVi-7B, Protocol=Fully Trained2026.05 | 59.1 | 56.6 | 61.6 | — | |
| SteerSegBackbone=Qwen2.5VL-7B, Training Protocol=Frozen-LVLM, Training-free=false2026.05 | 56.6 | 53.5 | 59.8 | — | |
| Omni-R1-8BVenue=NeurIPS20252026.05 | 56.2 | — | — | — | |
| HyperSeg-3BModel size=3B2025.08 | 55.7 | 53.1 | 58.4 | — | |
| HyperSeg-3BVenue=CVPR20252026.05 | 55.7 | 53.1 | 58.4 | — | |
| GLUS-7BModel size=7B2025.08 | 54.9 | 52.4 | 57.3 | 17.9 | |
| GLUSBackbone=LLaVA-7B, Protocol=Fully Trained2026.05 | 54.9 | 52.4 | 57.3 | — | |
| GLUS-7BVenue=CVPR20252026.05 | 54.8 | 52.4 | 57.3 | — | |
| InstructSeg-3BModel size=3B2025.08 | 54.5 | 52 | 56.9 | — | |
| InstructSeg-3BVenue=ICCV20252026.05 | 54.5 | 52 | 56.9 | — | |
| DecAF*Backbone=Qwen2.5VL-7B, Training Protocol=Frozen-LVLM, Training-free=true2026.05 | 54.2 | 50.1 | 58.2 | — | |
| SteerSegBackbone=Qwen2VL-7B, Training Protocol=Frozen-LVLM, Training-free=false2026.05 | 53.8 | 50.4 | 57.1 | — | |
| SteerSegBackbone=InternVL3-8B, Training Protocol=Frozen-LVLM, Training-free=false2026.05 | 52.5 | 48.8 | 56.2 | — | |
| TrajSegBackbone=LLaVA-7B2026.03 | 51.1 | 48.8 | 53.3 | — | |
| VISA-13BModel size=13B2025.08 | 50.9 | 48.8 | 52.9 | 14.5 | |
| VISABackbone=Chat-UniVi-13B2026.03 | 50.9 | 48.8 | 52.9 | — | |
| VISA-13BVenue=ECCV20242026.05 | 50.9 | 48.8 | 52.9 | — | |
| VISABackbone=LLaVA-13B2026.03 | 50.8 | 48.8 | 52.8 | — | |
| SteerSegBackbone=LLaVA-OV-7B, Training Protocol=Frozen-LVLM, Training-free=false2026.05 | 49.2 | 45.6 | 52.8 | — | |
| DecAF*Backbone=InternVL3-8B, Training Protocol=Frozen-LVLM, Training-free=true2026.05 | 47.4 | 43.7 | 51.2 | — | |
| VISABackbone=LLaVA-7B2026.03 | 47.1 | 44.9 | 49.2 | — | |
| Loc-Head*Backbone=Qwen2.5VL-7B, Training Protocol=Frozen-LVLM, Training-free=true2026.05 | 47 | 43.3 | 50.7 | — | |
| VISA-7BModel size=7B2025.08 | 46.9 | 44.9 | 49 | 15.5 | |
| VISABackbone=Chat-UniVi-7B2026.03 | 46.9 | 44.9 | 49 | — | |
| VISA-7BVenue=ECCV20242026.05 | 46.9 | 44.9 | 49 | — | |
| VISABackbone=ChatUniVi-7B, Protocol=Fully Trained2026.05 | 46.9 | 44.9 | 49 | — | |
| DecAF*Backbone=Qwen2VL-7B, Training Protocol=Frozen-LVLM, Training-free=true2026.05 | 45.3 | 41.6 | 49 | — | |
| TrackGPTBackbone=LLaVA-13B2026.03 | 45 | 43.2 | 46.8 | — | |
| Loc-Head*Backbone=Qwen2VL-7B, Training Protocol=Frozen-LVLM, Training-free=true2026.05 | 44 | 40.8 | 47.2 | — | |
| Loc-Head*Backbone=InternVL3-8B, Training Protocol=Frozen-LVLM, Training-free=true2026.05 | 43.7 | 39.9 | 47.5 | — | |
| TrackGPTBackbone=LLaVA-7B2026.03 | 43.6 | 41.8 | 45.5 | — | |
| LISA-13BModel size=13B2025.08 | 41.6 | 39.8 | 43.5 | 8.6 | |
| LISA-7BModel size=7B2025.08 | 40.9 | 39.1 | 42.7 | 9.3 | |
| LISABackbone=LLaVA-7B, Protocol=Fully Trained2026.05 | 40.9 | 39.1 | 42.7 | — | |
| DecAF*Backbone=LLaVA-OV-7B, Training Protocol=Frozen-LVLM, Training-free=true2026.05 | 40 | 35.8 | 44.1 | — | |
| Loc-Head*Backbone=LLaVA-7B, Training Protocol=Frozen-LVLM, Training-free=true2026.05 | 32.5 | 28.2 | 36.9 | — | |
| ReferFormerBackbone=Video-Swin-B2026.03 | 28.1 | 26.2 | 29.9 | — | |
| LMPM2025.08 | 26.4 | 21.2 | 31.7 | 3.2 | |
| LMPMBackbone=Swin-T2026.03 | 26.4 | 21.2 | 31.7 | — | |
| MTTRBackbone=Video-Swin-T2026.03 | 25.5 | 25.1 | 25.9 | — |