Referring Expression Segmentation on RefCOCO (testA)
91.2cIoUEmpirical Upper Bound
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Empirical Upper BoundTraining regime=Oracle reference2026.05 | 91.2 | — | — | — | — | — | — | — | — | — | — | |
| FlowSegLLM=Qwen3-4B2026.05 | 87.4 | — | — | — | — | — | — | — | — | — | — | |
| X-SAMVersion=Phi3 3.8B, Training RES=true2025.12 | 87.1 | — | — | — | — | — | — | — | — | — | — | |
| X-SAM2026.05 | 87.1 | — | — | — | — | — | — | — | — | — | — | |
| X-SAM2026.05 | 87.1 | — | — | — | — | — | — | — | — | — | — | |
| SELF1E-SEG-8Bw/o SMD=true, 1-Token=true, finetuned=false2026.03 | 86.2 | — | — | — | — | — | — | — | — | — | — | |
| HyperSegType=MLLM-based Segmentation Network, SAM-based=false2024.11 | 85.7 | — | — | — | — | — | — | — | — | — | — | |
| HyperSegVersion=Phi2 2.7B, Training RES=true2025.12 | 85.7 | — | — | — | — | — | — | — | — | — | — | |
| HyperSegw/o SMD=false, 1-Token=false, finetuned=false2026.03 | 85.7 | — | — | — | — | — | — | — | — | — | — | |
| HyperSeg2026.05 | 85.7 | — | — | — | — | — | — | — | — | — | — | |
| HyperSeg2026.05 | 85.7 | — | — | — | — | — | — | — | — | — | — | |
| SELF1E-SEG-2Bw/o SMD=true, 1-Token=true, finetuned=false2026.03 | 85.4 | — | — | — | — | — | — | — | — | — | — | |
| RICEVersion=Qwen2.5-7B, Training RES=true2025.12 | 85.3 | — | — | — | — | — | — | — | — | — | — | |
| MLCD-segVersion=Qwen2.5-7B, Training RES=true2025.12 | 85.3 | — | — | — | — | — | — | — | — | — | — | |
| LENSVersion=Qwen2.5-VL 3B, Training RES=true2025.12 | 85.3 | — | — | — | — | — | — | — | — | — | — | |
| RICEModel Version=Qwen2.5, Model Params=7B, RES Train=Y2025.12 | 85.3 | — | — | — | — | — | — | — | — | — | — | |
| RICE2026.05 | 85.3 | — | — | — | — | — | — | — | — | — | — | |
| HiMTok-8B(ft)w/o SMD=false, 1-Token=false, finetuned=true2026.03 | 85.2 | — | — | — | — | — | — | — | — | — | — | |
| u-LLaVAw/o SMD=false, 1-Token=true, finetuned=false2026.03 | 85.1 | — | — | — | — | — | — | — | — | — | — | |
| Qwen3VL-SAMTokSize=4B2026.01 | 85 | — | — | — | — | — | — | — | — | — | — | |
| PSALMType=MLLM-based Segmentation Network, SAM-based=false2024.11 | 84.7 | — | — | — | — | — | — | — | — | — | — | |
| PSALMtraining_regime=fine-tuning, model_type=LVLM2025.03 | 84.7 | — | — | — | — | — | — | — | — | — | — | |
| PSALMText Prompt Encoder=Phi-1.5 (1.3B), SAM?=false, Training Data=C, RC, CI2024.06 | 84.7 | — | — | — | — | — | — | — | — | — | — | |
| PSALMVersion=Phi1.5 1.3B, Training RES=true2025.12 | 84.7 | — | — | — | — | — | — | — | — | — | — | |
| PSALMw/o SMD=false, 1-Token=false, finetuned=false2026.03 | 84.7 | — | — | — | — | — | — | — | — | — | — | |
| PSALM2026.05 | 84.7 | — | — | — | — | — | — | — | — | — | — | |
| PSALM2026.05 | 84.7 | — | — | — | — | — | — | — | — | — | — | |
| SETCON2026.05 | 84.4 | — | — | — | — | — | — | — | — | — | — | |
| EVF-SAMText Prompt Encoder=BEIT-3 (673M), SAM?=true, Training Data=RC, O, A, PP, PIN, HP2024.06 | 84.2 | — | — | — | — | — | — | — | — | — | — | |
| Sa2VASize=4B2026.01 | 84.2 | — | — | — | — | — | — | — | — | — | — | |
| EVF-SAMVersion=Extra Data, Training RES=true2025.12 | 84.2 | — | — | — | — | — | — | — | — | — | — | |
| EVF-SAMModel Version=Extra Data, Model Params=-, RES Train=Y2025.12 | 84.2 | — | — | — | — | — | — | — | — | — | — | |
| EVF-SAM2026.05 | 84.2 | — | — | — | — | — | — | — | — | — | — | |
| Qwen25VL-SAMTokSize=3B2026.01 | 83.9 | — | — | — | — | — | — | — | — | — | — | |
| SELF1E-8Bw/o SMD=true, 1-Token=true, finetuned=false2026.03 | 83.8 | — | — | — | — | — | — | — | — | — | — | |
| EVF-SAMText Prompt Encoder=BEIT-3 (673M), SAM?=true, Training Data=RC2024.06 | 83.7 | — | — | — | — | — | — | — | — | — | — | |
| EVF-SAMVersion=RC, Training RES=true2025.12 | 83.7 | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-Seg4BBackbone=Qwen3-VL-4B2026.05 | 83.7 | — | — | — | — | — | — | — | — | — | — | |
| UniPixelSize=3B2026.01 | 83.5 | — | — | — | — | — | — | — | — | — | — | |
| UGround-7BParameters=7B2025.10 | 83.5 | — | — | — | — | — | — | — | — | — | — | |
| UNINEXTModel Category=Specialist Segmentation Model2024.03 | 83.4 | — | — | — | — | — | — | — | — | — | — | |
| UNINEXTtraining_regime=fine-tuning2025.03 | 83.4 | — | — | — | — | — | — | — | — | — | — | |
| UNINEXT-HText Prompt Encoder=BERT-B (104M), SAM?=false, Training Data=O, C, RC, V2024.06 | 83.4 | — | — | — | — | — | — | — | — | — | — | |
| GLaMMType=MLLM-based Segmentation Network, SAM-based=true2024.11 | 83.2 | — | — | — | — | — | — | — | — | — | — | |
| GLaMMtraining_regime=fine-tuning, model_type=LVLM2025.03 | 83.2 | — | — | — | — | — | — | — | — | — | — | |
| UniLSeg-100Text Prompt Encoder=CLIP-B (63M), SAM?=false, Training Data=SA, RC, gRC2024.06 | 83.2 | — | — | — | — | — | — | — | — | — | — | |
| GLAMMText Prompt Encoder=Vicuna (7B), SAM?=true, Training Data=G, RC2024.06 | 83.2 | — | — | — | — | — | — | — | — | — | — | |
| GLaMMVersion=Vicuna 7B, Training RES=true2025.12 | 83.2 | — | — | — | — | — | — | — | — | — | — | |
| UniLSegVersion=UniLSeg-100, Training RES=true2025.12 | 83.2 | — | — | — | — | — | — | — | — | — | — | |
| UniLSegModel Version=UniLSeg-100, Model Params=-, RES Train=Y2025.12 | 83.2 | — | — | — | — | — | — | — | — | — | — | |
| GLaMMModel Version=Vicuna, Model Params=7B, RES Train=Y2025.12 | 83.2 | — | — | — | — | — | — | — | — | — | — | |
| GLaMM-7BParameters=7B2025.10 | 83.2 | — | — | — | — | — | — | — | — | — | — | |
| GLaMMw/o SMD=false, 1-Token=true, finetuned=false2026.03 | 83.2 | — | — | — | — | — | — | — | — | — | — | |
| GLaMM2026.05 | 83.2 | — | — | — | — | — | — | — | — | — | — | |
| UniLSeg2026.05 | 83.2 | — | — | — | — | — | — | — | — | — | — | |
| RSAgent (ours)Model Version=Qwen2.5-VL, Model Params=7B, RES Train=Y2025.12 | 83.1 | — | — | — | — | — | — | — | — | — | — | |
| SAM4MLLM-7BType=MLLM-based Segmentation Network, SAM-based=false2024.11 | 82.8 | — | — | — | — | — | — | — | — | — | — | |
| SAM4MLLMVersion=LLaVA1.6 7B, Training RES=true2025.12 | 82.8 | — | — | — | — | — | — | — | — | — | — | |
| SAM4MLLM-7BLLM=7B2026.05 | 82.8 | — | — | — | — | — | — | — | — | — | — | |
| u-LLAVAText Prompt Encoder=Vicuna (7B), SAM?=true, Training Data=A, CS, RC, PL, PV2024.06 | 82.7 | — | — | — | — | — | — | — | — | — | — | |
| SAM4MLLMVersion=LLaVA1.6 8B, Training RES=true2025.12 | 82.7 | — | — | — | — | — | — | — | — | — | — | |
| SAM4MLLMModel Version=LLaVA1.6, Model Params=8B, RES Train=Y2025.12 | 82.7 | — | — | — | — | — | — | — | — | — | — | |
| SAM4MLLM-8Bw/o SMD=false, finetuned=false2026.03 | 82.7 | — | — | — | — | — | — | — | — | — | — | |
| SAM4MLLM2026.05 | 82.7 | — | — | — | — | — | — | — | — | — | — | |
| UFO-8B(ft)w/o SMD=true, 1-Token=false, finetuned=true2026.03 | 82.6 | — | — | — | — | — | — | — | — | — | — | |
| UnipixelQwen2.5-VL-3BBackbone=Qwen2.5-VL-3B2026.05 | 82.6 | — | — | — | — | — | — | — | — | — | — | |
| MLLMSeg2026.05 | 82.4 | — | — | — | — | — | — | — | — | — | — | |
| UniRef++training_regime=fine-tuning2025.03 | 82.1 | — | — | — | — | — | — | — | — | — | — | |
| UniRef++-LText Prompt Encoder=BERT-B (104M), SAM?=false, Training Data=RC, F, V2024.06 | 82.1 | — | — | — | — | — | — | — | — | — | — | |
| SELF1E-2Bw/o SMD=true, 1-Token=true, finetuned=false2026.03 | 82.1 | — | — | — | — | — | — | — | — | — | — | |
| POPENFinetuning=true2025.04 | 82 | — | — | — | — | — | — | — | — | — | — | |
| Youtu-VL4BBackbone=VL4B2026.05 | 82 | — | — | — | — | — | — | — | — | — | — | |
| DETRISVersion=DETRIS-L, Training RES=true2025.12 | 81.9 | — | — | — | — | — | — | — | — | — | — | |
| DETRISModel Version=DETRIS-L, Model Params=-, RES Train=Y2025.12 | 81.9 | — | — | — | — | — | — | — | — | — | — | |
| DETRIS2026.05 | 81.9 | — | — | — | — | — | — | — | — | — | — | |
| PinPoint_msmTraining regime=Training-Free2026.05 | 81.9 | — | — | — | — | — | — | — | — | — | — | |
| UniLSegVersion=UniLSeg-20, Training RES=true2025.12 | 81.8 | — | — | — | — | — | — | — | — | — | — | |
| Text4Seg (w/ SAM)Architecture Style=Decoder-based2026.01 | 81.7 | — | — | — | — | — | — | — | — | — | — | |
| GSVAVersion=13B, Training RES=true2025.12 | 81.7 | — | — | — | — | — | — | — | — | — | — | |
| GSVAModel Version=LLaVA1.5, Model Params=13B, RES Train=Y2025.12 | 81.7 | — | — | — | — | — | — | — | — | — | — | |
| Text4SegInternVL2-8BBackbone=InternVL2-8B2026.05 | 81.7 | — | — | — | — | — | — | — | — | — | — | |
| GSVA2026.05 | 81.7 | — | — | — | — | — | — | — | — | — | — | |
| Text4Seg2026.05 | 81.7 | — | — | — | — | — | — | — | — | — | — | |
| PinPoint_multTraining regime=Training-Free2026.05 | 81.7 | — | — | — | — | — | — | — | — | — | — | |
| UFO-8Bw/o SMD=true, 1-Token=false, finetuned=false2026.03 | 81.6 | — | — | — | — | — | — | — | — | — | — | |
| PaDT ProSize=3B2026.01 | 81.5 | — | — | — | — | — | — | — | — | — | — | |
| SegLLM-7BParameters=7B2025.10 | 81.5 | — | — | — | — | — | — | — | — | — | — | |
| SegAgent-LLaVA+SAMBackbone=LLaVA, Interactive Model=SAM2025.03 | 81.44 | — | — | — | — | — | — | — | — | — | — | |
| SegAgentVersion=Qwen-VL 7B, Training RES=true2025.12 | 81.4 | — | — | — | — | — | — | — | — | — | — | |
| SegAgent+SAMLLaVA-7BBackbone=LLaVA-7B2026.05 | 81.4 | — | — | — | — | — | — | — | — | — | — | |
| MLLMSegInternVL2.5-4BBackbone=InternVL2.5-4B2026.05 | 81.4 | — | — | — | — | — | — | — | — | — | — | |
| SegAgent-Qwen+SClickBackbone=Qwen, Interactive Model=SimpleClick2025.03 | 81.35 | — | — | — | — | — | — | — | — | — | — | |
| HiMTok-8Bw/o SMD=false, 1-Token=false, finetuned=false2026.03 | 81.2 | — | — | — | — | — | — | — | — | — | — | |
| RSAgent-singleModel Version=Qwen2.5, Model Params=7B, RES Train=Y2025.12 | 81.1 | — | — | — | — | — | — | — | — | — | — | |
| SAM4MLLM(Qwen)Venue=ECCV'24, Backbone=Qwen, Interactive Model=SAM2025.03 | 80.9 | — | — | — | — | — | — | — | — | — | — | |
| CoT-Segself-correction=false2026.01 | 80.9 | — | — | — | — | — | — | — | — | — | — | |
| CoT-Segself-correction=true2026.01 | 80.9 | — | — | — | — | — | — | — | — | — | — | |
| SAM4MLLMTraining regime=Supervised Fine-tuning2026.05 | 80.9 | — | — | — | — | — | — | — | — | — | — | |
| SAM-VeteranVersion=Qwen2.5-VL 7B, Training RES=true2025.12 | 80.8 | — | — | — | — | — | — | — | — | — | — | |
| SAM-Veteran-7BTraining regime=Reinforcement-Learning Tuning2026.05 | 80.8 | — | — | — | — | — | — | — | — | — | — |