Referring Video Object Segmentation on MeViS (val)
0.635J&F ScoreMolmoPoint-8B
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| MolmoPoint-8BCategory=MolmoPoint2026.03 | 0.635 | — | — | — | |
| Molmo2-4BAccess=Open weights, Open data (no distillation), Open code2026.01 | 0.633 | — | — | — | |
| Molmo2-4BCategory=Fully open2026.03 | 0.633 | — | — | — | |
| VIRSTCategory=MLLM-based Segmentation Method, Venue=-2026.03 | 0.629 | 0.604 | 0.654 | — | |
| Molmo2-8BAccess=Open weights, Open data (no distillation), Open code2026.01 | 0.623 | — | — | — | |
| Molmo2-8BCategory=Fully open2026.03 | 0.623 | — | — | — | |
| Molmo2-O-7BAccess=Open weights, Open data (no distillation), Open code2026.01 | 0.584 | — | — | — | |
| Molmo2-O-7BCategory=Fully open2026.03 | 0.584 | — | — | — | |
| VideoMolmo-7BAccess=Specialized open models2026.01 | 0.539 | — | — | — | |
| VideoMolmo-7BCategory=Fully open2026.03 | 0.539 | — | — | — | |
| MPG-SAM2Category=Segmentation Expert, Venue=ICCV’252026.03 | 0.537 | 0.507 | 0.567 | — | |
| FindTrack++N=10, fine-tuning=true2025.03 | 0.532 | 0.505 | 0.559 | — | |
| SAMWISECategory=Segmentation Expert, Venue=CVPR’252026.03 | 0.524 | 0.495 | 0.466 | — | |
| FindTrack++N=5, fine-tuning=true2025.03 | 0.521 | 0.494 | 0.549 | — | |
| VideoLoomParameters=8B2026.01 | 0.517 | — | — | — | |
| GLUSLLM usage=yes, SFT strategy=additional-SFT2025.04 | 0.513 | 0.485 | 0.542 | — | |
| GLUSParameters=7B2026.01 | 0.513 | — | — | — | |
| VRS-HQBackbone=Chat-UniVi-13B2025.01 | 0.509 | 0.48 | 0.537 | — | |
| VRS-HQParameters=13B2026.01 | 0.509 | — | — | — | |
| VRS-HQ-13BCategory=MLLM-based Segmentation Method, Venue=CVPR’252026.03 | 0.509 | 0.48 | 0.537 | — | |
| VRS-HQBackbone=Chat-UniVi-7B2025.01 | 0.506 | 0.476 | 0.537 | — | |
| VRS-HQParameters=7B2026.01 | 0.506 | — | — | — | |
| VRS-HQ-7BCategory=MLLM-based Segmentation Method, Venue=CVPR’252026.03 | 0.506 | 0.476 | 0.537 | — | |
| GLUSLLM usage=yes, SFT strategy=standard-SFT2025.04 | 0.503 | 0.475 | 0.532 | — | |
| SAMWISEPublication=CVPR'252025.03 | 0.495 | 0.466 | 0.524 | — | |
| ViLLaParameters=6B2026.01 | 0.494 | — | — | — | |
| ViLLa-6BCategory=MLLM-based Segmentation Method, Venue=ICCV’252026.03 | 0.494 | 0.465 | 0.523 | — | |
| ReferDINOCategory=Segmentation Expert, Venue=ICCV’252026.03 | 0.493 | 0.447 | 0.539 | — | |
| DMVSPublication=CVPR'252025.03 | 0.486 | 0.442 | 0.529 | — | |
| SSAPublication=CVPR'252025.03 | 0.486 | 0.44 | 0.532 | — | |
| DMVSPublication=CVPR 20252026.03 | 0.486 | 0.442 | 0.529 | — | |
| SSAPublication=CVPR 20252026.03 | 0.486 | 0.44 | 0.532 | — | |
| SDAMPublication=Ours2026.03 | 0.486 | 0.455 | 0.517 | — | |
| FindTrackN=102025.03 | 0.482 | 0.456 | 0.507 | — | |
| DsHmp + MTCMmodule=Multi-Context Enhancer (MTCM)2025.01 | 0.476 | 0.441 | 0.511 | — | |
| VideoChat-TPOFine-tuning=true2025.01 | 0.47 | — | — | — | |
| FindTrackN=52025.03 | 0.47 | 0.443 | 0.497 | — | |
| Sa2VA-8BAccess=Specialized open models2026.01 | 0.469 | — | — | — | |
| Molmo + SAM 2Access=Specialized open models2026.01 | 0.469 | — | — | — | |
| Sa2VAParameters=8B2026.01 | 0.469 | — | — | — | |
| Sa2VA-8BCategory=Specialized open models2026.03 | 0.469 | — | — | — | |
| Molmo + SAM 2Category=Fully open2026.03 | 0.469 | — | — | — | |
| DsHmpPublication=CVPR'242025.03 | 0.464 | 0.43 | 0.498 | — | |
| DsHmpBackbone=Swin-Tiny2024.04 | 0.464 | 0.43 | 0.498 | — | |
| DsHmp2024.05 | 0.464 | 0.43 | 0.498 | — | |
| DsHmp2024.05 | 0.464 | 0.43 | 0.498 | — | |
| DsHmp2025.01 | 0.464 | 0.43 | 0.498 | — | |
| DsHmpLLM usage=no2025.04 | 0.464 | 0.43 | 0.498 | — | |
| VLP-RVOSVisual Backbone=VLMo-B2024.05 | 0.454 | 0.42 | 0.488 | — | |
| VideoGLaMMLLM usage=yes2025.04 | 0.452 | 0.421 | 0.482 | — | |
| VideoGLaMMAccess=Specialized open models2026.01 | 0.452 | — | — | — | |
| VideoGLaMMCategory=MLLM-based Segmentation Method, Venue=CVPR’252026.03 | 0.452 | 0.421 | 0.482 | — | |
| VideoGLaMMCategory=Specialized open models2026.03 | 0.452 | — | — | — | |
| VideoGLaMMRetained Tokens=576, Pruning Ratio=0%2026.05 | 0.4515 | 0.4207 | 0.4823 | 100 | |
| LiteLVLMRetained Tokens=196, Pruning Ratio=65.9%2026.05 | 0.4508 | 0.4206 | 0.481 | 99.8 | |
| VisPrunerRetained Tokens=196, Pruning Ratio=65.9%2026.05 | 0.4494 | 0.4193 | 0.4796 | 99.5 | |
| LiteLVLMRetained Tokens=81, Pruning Ratio=85.9%2026.05 | 0.4473 | 0.4164 | 0.4782 | 99 | |
| VLP-RVOSVisual Backbone=ViT-B/16 CLIP2024.05 | 0.446 | 0.413 | 0.48 | — | |
| ReLABackbone=Video-Swin-B2026.01 | 0.446 | 0.417 | 0.475 | — | |
| VisPrunerRetained Tokens=81, Pruning Ratio=85.9%2026.05 | 0.4459 | 0.4135 | 0.4783 | 98.7 | |
| VISABackbone=Chat-UniVi-13B2025.01 | 0.445 | 0.418 | 0.471 | — | |
| VISALLM usage=yes, Model Size=13B2025.04 | 0.445 | 0.418 | 0.471 | — | |
| VISAPublication=ECCV 20242026.03 | 0.445 | 0.418 | 0.471 | — | |
| VISA-13BCategory=MLLM-based Segmentation Method, Venue=ECCV’242026.03 | 0.445 | 0.418 | 0.471 | — | |
| VideoLISAFine-tuning=true2025.01 | 0.444 | — | — | — | |
| VideoLISA-3.8BYear=2024, configuration=Post-optimization2024.09 | 0.444 | 0.413 | 0.476 | — | |
| VideoLISABackbone=LLaVA-Phi-3-V2025.01 | 0.444 | 0.413 | 0.476 | — | |
| VideoLISALLM usage=yes, Model Size=3.8B2025.04 | 0.444 | 0.413 | 0.476 | — | |
| VideoLISAAccess=Specialized open models2026.01 | 0.444 | — | — | — | |
| VideoLISAPublication=NeurIPS 20242026.03 | 0.444 | 0.413 | 0.476 | — | |
| VideoLISACategory=MLLM-based Segmentation Method, Venue=NeurIPS’242026.03 | 0.444 | 0.413 | 0.476 | — | |
| VideoLISACategory=Specialized open models2026.03 | 0.444 | — | — | — | |
| VISABackbone=Chat-UniVi-7B2025.01 | 0.435 | 0.407 | 0.463 | — | |
| VISALLM usage=yes, Model Size=7B2025.04 | 0.435 | 0.407 | 0.463 | — | |
| VISAParameters=7B2026.01 | 0.435 | — | — | — | |
| VISA-7BCategory=MLLM-based Segmentation Method, Venue=ECCV’242026.03 | 0.435 | 0.407 | 0.463 | — | |
| MABP2024.05 | 0.434 | 0.399 | 0.469 | — | |
| HTRBackbone=tiny2024.03 | 0.427 | 0.399 | 0.455 | — | |
| HTR2024.05 | 0.427 | 0.399 | 0.455 | — | |
| Gemini 3 ProAccess=API call only2026.01 | 0.425 | — | — | — | |
| Gemini 3 ProCategory=API call only2026.03 | 0.425 | — | — | — | |
| VideoLISA-3.8BYear=2024, configuration=One-Token-Seg-All2024.09 | 0.423 | 0.394 | 0.452 | — | |
| LMPM + MTCMmodule=Multi-Context Enhancer (MTCM)2025.01 | 0.423 | 0.384 | 0.464 | — | |
| TrackGPTBackbone=LLaVA-13B2025.01 | 0.412 | 0.392 | 0.431 | — | |
| TrackGPTLLM usage=yes, Model Size=13B2025.04 | 0.412 | 0.392 | 0.431 | — | |
| Gemini 2.5 ProAccess=API call only2026.01 | 0.407 | — | — | — | |
| Gemini 2.5 ProCategory=API call only2026.03 | 0.407 | — | — | — | |
| TrackGPTBackbone=LLaVA-7B2025.01 | 0.401 | 0.376 | 0.426 | — | |
| TrackGPTLLM usage=yes, Model Size=7B2025.04 | 0.401 | 0.376 | 0.426 | — | |
| TrackGPTParameters=7B2026.01 | 0.401 | — | — | — | |
| LISABackbone=LLaVA-13B2025.01 | 0.379 | 0.358 | 0.4 | — | |
| LISALLM usage=yes, Model Size=13B2025.04 | 0.379 | 0.358 | 0.4 | — | |
| LISAPublication=CVPR 20242026.03 | 0.379 | 0.358 | 0.4 | — | |
| LMPMBackbone=Swin-Tiny2024.04 | 0.372 | 0.342 | 0.402 | — | |
| LMPM2024.05 | 0.372 | 0.342 | 0.402 | — | |
| LMPMYear=20232024.09 | 0.372 | 0.342 | 0.402 | — | |
| LMPM2024.03 | 0.372 | 0.342 | 0.402 | — | |
| LMPM2024.05 | 0.372 | 0.342 | 0.402 | — | |
| LMPM2025.01 | 0.372 | 0.342 | 0.402 | — | |
| LMPMBackbone=Swin-T2025.01 | 0.372 | 0.342 | 0.402 | — |