Referring Expression Segmentation on RefCOCO (testB)
92cIoUEmpirical Upper Bound
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Empirical Upper BoundTraining regime=Oracle reference2026.05 | 92 | — | — | — | — | — | — | — | — | |
| FlowSegLLM=Qwen3-4B2026.05 | 84.8 | — | — | — | — | — | — | — | — | |
| HiMTok-8B(ft)w/o SMD=false, 1-Token=false, finetuned=true2026.03 | 83.5 | — | — | — | — | — | — | — | — | |
| HyperSegType=MLLM-based Segmentation Network, SAM-based=false2024.11 | 83.4 | — | — | — | — | — | — | — | — | |
| HyperSegw/o SMD=false, 1-Token=false, finetuned=false2026.03 | 83.4 | — | — | — | — | — | — | — | — | |
| SELF1E-SEG-8Bw/o SMD=true, 1-Token=true, finetuned=false2026.03 | 83.4 | — | — | — | — | — | — | — | — | |
| HyperSeg2026.05 | 83.4 | — | — | — | — | — | — | — | — | |
| X-SAM2026.05 | 83.4 | — | — | — | — | — | — | — | — | |
| HyperSeg2026.05 | 83.4 | — | — | — | — | — | — | — | — | |
| X-SAM2026.05 | 83.4 | — | — | — | — | — | — | — | — | |
| SELF1E-SEG-2Bw/o SMD=true, 1-Token=true, finetuned=false2026.03 | 82.3 | — | — | — | — | — | — | — | — | |
| PaDT ProSize=3B2026.01 | 82.2 | — | — | — | — | — | — | — | — | |
| RSAgent (ours)Model Version=Qwen2.5-VL, Model Params=7B, RES Train=Y2025.12 | 82.2 | — | — | — | — | — | — | — | — | |
| Qwen3VL-SAMTokSize=4B2026.01 | 82.1 | — | — | — | — | — | — | — | — | |
| RICEModel Version=Qwen2.5, Model Params=7B, RES Train=Y2025.12 | 81.7 | — | — | — | — | — | — | — | — | |
| RICE2026.05 | 81.7 | — | — | — | — | — | — | — | — | |
| PSALMType=MLLM-based Segmentation Network, SAM-based=false2024.11 | 81.6 | — | — | — | — | — | — | — | — | |
| PSALMtraining_regime=fine-tuning, model_type=LVLM2025.03 | 81.6 | — | — | — | — | — | — | — | — | |
| PSALMText Prompt Encoder=Phi-1.5 (1.3B), SAM?=false, Training Data=C, RC, CI2024.06 | 81.6 | — | — | — | — | — | — | — | — | |
| PSALMw/o SMD=false, 1-Token=false, finetuned=false2026.03 | 81.6 | — | — | — | — | — | — | — | — | |
| PSALM2026.05 | 81.6 | — | — | — | — | — | — | — | — | |
| SETCON2026.05 | 81.6 | — | — | — | — | — | — | — | — | |
| PSALM2026.05 | 81.6 | — | — | — | — | — | — | — | — | |
| UNINEXTModel Category=Specialist Segmentation Model2024.03 | 81.3 | — | — | — | — | — | — | — | — | |
| UNINEXTtraining_regime=fine-tuning2025.03 | 81.3 | — | — | — | — | — | — | — | — | |
| UNINEXT-HText Prompt Encoder=BERT-B (104M), SAM?=false, Training Data=O, C, RC, V2024.06 | 81.3 | — | — | — | — | — | — | — | — | |
| u-LLaVAw/o SMD=false, 1-Token=true, finetuned=false2026.03 | 80.5 | — | — | — | — | — | — | — | — | |
| EVF-SAMText Prompt Encoder=BEIT-3 (673M), SAM?=true, Training Data=RC, O, A, PP, PIN, HP2024.06 | 80.2 | — | — | — | — | — | — | — | — | |
| EVF-SAMModel Version=Extra Data, Model Params=-, RES Train=Y2025.12 | 80.2 | — | — | — | — | — | — | — | — | |
| EVF-SAM2026.05 | 80.2 | — | — | — | — | — | — | — | — | |
| SELF1E-8Bw/o SMD=true, 1-Token=true, finetuned=false2026.03 | 80.1 | — | — | — | — | — | — | — | — | |
| EVF-SAMText Prompt Encoder=BEIT-3 (673M), SAM?=true, Training Data=RC2024.06 | 80 | — | — | — | — | — | — | — | — | |
| UniLSeg-100Text Prompt Encoder=CLIP-B (63M), SAM?=false, Training Data=SA, RC, gRC2024.06 | 79.9 | — | — | — | — | — | — | — | — | |
| Qwen25VL-SAMTokSize=3B2026.01 | 79.9 | — | — | — | — | — | — | — | — | |
| UniLSegModel Version=UniLSeg-100, Model Params=-, RES Train=Y2025.12 | 79.9 | — | — | — | — | — | — | — | — | |
| UniLSeg2026.05 | 79.9 | — | — | — | — | — | — | — | — | |
| Sa2VASize=4B2026.01 | 79.5 | — | — | — | — | — | — | — | — | |
| HiMTok-8Bw/o SMD=false, 1-Token=false, finetuned=false2026.03 | 79.2 | — | — | — | — | — | — | — | — | |
| Qwen3-VL-Seg4BBackbone=Qwen3-VL-4B2026.05 | 79.1 | — | — | — | — | — | — | — | — | |
| DETRISModel Version=DETRIS-L, Model Params=-, RES Train=Y2025.12 | 79 | — | — | — | — | — | — | — | — | |
| DETRIS2026.05 | 79 | — | — | — | — | — | — | — | — | |
| RSAgent-singleModel Version=Qwen2.5, Model Params=7B, RES Train=Y2025.12 | 78.9 | — | — | — | — | — | — | — | — | |
| MLLMSeg2026.05 | 78.7 | — | — | — | — | — | — | — | — | |
| UniPixelSize=3B2026.01 | 78.6 | — | — | — | — | — | — | — | — | |
| UFO-8B(ft)w/o SMD=true, 1-Token=false, finetuned=true2026.03 | 78.6 | — | — | — | — | — | — | — | — | |
| Youtu-VL4BBackbone=VL4B2026.05 | 78.4 | — | — | — | — | — | — | — | — | |
| UFO-8Bw/o SMD=true, 1-Token=false, finetuned=false2026.03 | 78.1 | — | — | — | — | — | — | — | — | |
| u-LLAVAText Prompt Encoder=Vicuna (7B), SAM?=true, Training Data=A, CS, RC, PL, PV2024.06 | 77.8 | — | — | — | — | — | — | — | — | |
| UGround-7BParameters=7B2025.10 | 77.7 | — | — | — | — | — | — | — | — | |
| MLLMSegInternVL2.5-4BBackbone=InternVL2.5-4B2026.05 | 77.7 | — | — | — | — | — | — | — | — | |
| SELF1E-2Bw/o SMD=true, 1-Token=true, finetuned=false2026.03 | 77.6 | — | — | — | — | — | — | — | — | |
| UniRef++training_regime=fine-tuning2025.03 | 77.5 | — | — | — | — | — | — | — | — | |
| UniRef++-LText Prompt Encoder=BERT-B (104M), SAM?=false, Training Data=RC, F, V2024.06 | 77.5 | — | — | — | — | — | — | — | — | |
| GSVAModel Version=LLaVA1.5, Model Params=13B, RES Train=Y2025.12 | 77.1 | — | — | — | — | — | — | — | — | |
| GSVA2026.05 | 77.1 | — | — | — | — | — | — | — | — | |
| GLaMMType=MLLM-based Segmentation Network, SAM-based=true2024.11 | 76.9 | — | — | — | — | — | — | — | — | |
| GLaMMtraining_regime=fine-tuning, model_type=LVLM2025.03 | 76.9 | — | — | — | — | — | — | — | — | |
| GLAMMText Prompt Encoder=Vicuna (7B), SAM?=true, Training Data=G, RC2024.06 | 76.9 | — | — | — | — | — | — | — | — | |
| GLaMMModel Version=Vicuna, Model Params=7B, RES Train=Y2025.12 | 76.9 | — | — | — | — | — | — | — | — | |
| GLaMM-7BParameters=7B2025.10 | 76.9 | — | — | — | — | — | — | — | — | |
| GLaMMw/o SMD=false, 1-Token=true, finetuned=false2026.03 | 76.9 | — | — | — | — | — | — | — | — | |
| UnipixelQwen2.5-VL-3BBackbone=Qwen2.5-VL-3B2026.05 | 76.9 | — | — | — | — | — | — | — | — | |
| GLaMM2026.05 | 76.9 | — | — | — | — | — | — | — | — | |
| SegAgent-Qwen+SClickBackbone=Qwen, Interactive Model=SimpleClick2025.03 | 76.57 | — | — | — | — | — | — | — | — | |
| SimpleSegArchitecture Style=Decoder-free, Pre-training status=true, Backbone=Kimi-VL2026.01 | 76.2 | — | — | — | — | — | — | — | — | |
| SAM4MLLM-7BType=MLLM-based Segmentation Network, SAM-based=false2024.11 | 76.1 | — | — | — | — | — | — | — | — | |
| SAM4MLLM-7BLLM=7B2026.05 | 76.1 | — | — | — | — | — | — | — | — | |
| SegAgent-LLaVA+SAMBackbone=LLaVA, Interactive Model=SAM2025.03 | 75.72 | — | — | — | — | — | — | — | — | |
| GroundHog-7BType=MLLM-based Segmentation Network, SAM-based=false2024.11 | 75.7 | — | — | — | — | — | — | — | — | |
| GroundhogArchitecture Style=Decoder-based2026.01 | 75.7 | — | — | — | — | — | — | — | — | |
| GroundHog-7Bw/o SMD=false, 1-Token=false, finetuned=false2026.03 | 75.7 | — | — | — | — | — | — | — | — | |
| SegAgent+SAMLLaVA-7BBackbone=LLaVA-7B2026.05 | 75.7 | — | — | — | — | — | — | — | — | |
| Text4Seg (w/ SAM)Architecture Style=Decoder-based2026.01 | 75.6 | — | — | — | — | — | — | — | — | |
| Text4SegInternVL2-8BBackbone=InternVL2-8B2026.05 | 75.6 | — | — | — | — | — | — | — | — | |
| UFOInternVL2-8BBackbone=InternVL2-8B2026.05 | 75.6 | — | — | — | — | — | — | — | — | |
| Text4Seg2026.05 | 75.6 | — | — | — | — | — | — | — | — | |
| SegLLM-7BParameters=7B2025.10 | 75.4 | — | — | — | — | — | — | — | — | |
| SimpleSegArchitecture Style=Decoder-free, Pre-training status=true, Backbone=Qwen2.5-VL-7B2026.01 | 75.2 | — | — | — | — | — | — | — | — | |
| SegAgent-Qwen+SAMBackbone=Qwen, Interactive Model=SAM2025.03 | 74.98 | — | — | — | — | — | — | — | — | |
| PolyFormer-LVenue=CVPR'232025.03 | 74.83 | — | — | — | — | — | — | — | — | |
| PolyFormer-LText Prompt Encoder=BERT-B (104M), SAM?=false, Training Data=RC, gRC2024.06 | 74.8 | — | — | — | — | — | — | — | — | |
| SAM4MLLMModel Version=LLaVA1.6, Model Params=8B, RES Train=Y2025.12 | 74.7 | — | — | — | — | — | — | — | — | |
| SAM4MLLM-8Bw/o SMD=false, finetuned=false2026.03 | 74.7 | — | — | — | — | — | — | — | — | |
| SAM4MLLM2026.05 | 74.7 | — | — | — | — | — | — | — | — | |
| PixelLLMText Prompt Encoder=T5-XL (3B), SAM?=true, Training Data=RC, GG2024.06 | 74.4 | — | — | — | — | — | — | — | — | |
| VisionLLM v2w/o SMD=false, 1-Token=true, finetuned=false2026.03 | 74.3 | — | — | — | — | — | — | — | — | |
| VisionLLM v2Vicuna-7BBackbone=Vicuna-7B2026.05 | 74.3 | — | — | — | — | — | — | — | — | |
| AnyRefModel Category=Generalist MLLM, Fine-tuned=true2024.03 | 74.2 | — | — | — | — | — | — | — | — | |
| GSVA-13Btraining_regime=fine-tuning, model_type=LVLM2025.03 | 74.2 | — | — | — | — | — | — | — | — | |
| AnyRefArchitecture Style=Decoder-based2026.01 | 74.2 | — | — | — | — | — | — | — | — | |
| AnyRefLLaVA-7B(ft)Backbone=LLaVA-7B, Fine-tuned=true2026.05 | 74.2 | — | — | — | — | — | — | — | — | |
| SegAgent-LLaVA+SClickBackbone=LLaVA, Interactive Model=SimpleClick2025.03 | 74.12 | — | — | — | — | — | — | — | — | |
| OMG-LLaVAType=MLLM-based Segmentation Network, SAM-based=false2024.11 | 74.1 | — | — | — | — | — | — | — | — | |
| OMG-LLaVA2025.02 | 74.1 | — | — | — | — | — | — | — | — | |
| POPENFinetuning=true2025.04 | 74.1 | — | — | — | — | — | — | — | — | |
| OMG-LLaVA2025.10 | 74.1 | — | — | — | — | — | — | — | — | |
| OMG-LLaVA(ft)w/o SMD=false, 1-Token=true, finetuned=true2026.03 | 74.1 | — | — | — | — | — | — | — | — | |
| LaSagnA-7BType=MLLM-based Segmentation Network, SAM-based=true2024.11 | 73.8 | — | — | — | — | — | — | — | — | |
| LaSagnAArchitecture Style=Decoder-based2026.01 | 73.8 | — | — | — | — | — | — | — | — | |
| UFOLLaVA-1.5-7BArchitecture Style=Decoder-free2026.01 | 73.8 | — | — | — | — | — | — | — | — |