Referring Expression Segmentation on RefCOCO (val)
91.2cIoUEmpirical Upper Bound
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Empirical Upper BoundTraining regime=Oracle reference2026.05 | 91.2 | — | — | — | — | — | — | — | — | |
| FlowSegLLM=Qwen3-4B2026.05 | 85.8 | — | — | — | — | — | — | — | — | |
| X-SAM2026.05 | 85.1 | — | — | — | — | — | — | — | — | |
| X-SAM2026.05 | 85.1 | — | — | — | — | — | — | — | — | |
| HiMTok-8B(ft)w/o SMD=false, 1-Token=false, finetuned=true2026.03 | 85 | — | — | — | — | — | — | — | — | |
| HyperSegType=MLLM-based Segmentation Network, SAM-based=false2024.11 | 84.8 | — | — | — | — | — | — | — | — | |
| HyperSegw/o SMD=false, 1-Token=false, finetuned=false2026.03 | 84.8 | — | — | — | — | — | — | — | — | |
| HyperSeg2026.05 | 84.8 | — | — | — | — | — | — | — | — | |
| HyperSeg2026.05 | 84.8 | — | — | — | — | — | — | — | — | |
| SELF1E-SEG-8Bw/o SMD=true, 1-Token=true, finetuned=false2026.03 | 84.7 | — | — | — | — | — | — | — | — | |
| SELF1E-SEG-2Bw/o SMD=true, 1-Token=true, finetuned=false2026.03 | 84.3 | — | — | — | — | — | — | — | — | |
| RSAgent (ours)Model Version=Qwen2.5-VL, Model Params=7B, RES Train=Y2025.12 | 83.7 | — | — | — | — | — | — | — | — | |
| SETCON2026.05 | 83.7 | — | — | — | — | — | — | — | — | |
| PSALMType=MLLM-based Segmentation Network, SAM-based=false2024.11 | 83.6 | — | — | — | — | — | — | — | — | |
| PSALMtraining_regime=fine-tuning, model_type=LVLM2025.03 | 83.6 | — | — | — | — | — | — | — | — | |
| PSALMText Prompt Encoder=Phi-1.5 (1.3B), SAM?=false, Training Data=C, RC, CI2024.06 | 83.6 | — | — | — | — | — | — | — | — | |
| PSALMEvaluation protocol=Finetuned-based2026.02 | 83.6 | — | — | — | — | — | — | — | — | |
| PSALMw/o SMD=false, 1-Token=false, finetuned=false2026.03 | 83.6 | — | — | — | — | — | — | — | — | |
| PSALM2026.05 | 83.6 | — | — | — | — | — | — | — | — | |
| PSALM2026.05 | 83.6 | — | — | — | — | — | — | — | — | |
| RICEModel Version=Qwen2.5, Model Params=7B, RES Train=Y2025.12 | 83.5 | — | — | — | — | — | — | — | — | |
| RICE2026.05 | 83.5 | — | — | — | — | — | — | — | — | |
| Qwen3VL-SAMTokSize=4B2026.01 | 83.4 | — | — | — | — | — | — | — | — | |
| u-LLaVAw/o SMD=false, 1-Token=true, finetuned=false2026.03 | 83 | — | — | — | — | — | — | — | — | |
| SELF1E-8Bw/o SMD=true, 1-Token=true, finetuned=false2026.03 | 82.5 | — | — | — | — | — | — | — | — | |
| EVF-SAMText Prompt Encoder=BEIT-3 (673M), SAM?=true, Training Data=RC, O, A, PP, PIN, HP2024.06 | 82.4 | — | — | — | — | — | — | — | — | |
| Sa2VASize=4B2026.01 | 82.4 | — | — | — | — | — | — | — | — | |
| Qwen25VL-SAMTokSize=3B2026.01 | 82.4 | — | — | — | — | — | — | — | — | |
| EVF-SAMModel Version=Extra Data, Model Params=-, RES Train=Y2025.12 | 82.4 | — | — | — | — | — | — | — | — | |
| EVF-SAM2026.05 | 82.4 | — | — | — | — | — | — | — | — | |
| Qwen3-VL-Seg4BBackbone=Qwen3-VL-4B2026.05 | 82.3 | — | — | — | — | — | — | — | — | |
| UNINEXTModel Category=Specialist Segmentation Model2024.03 | 82.2 | — | — | — | — | — | — | — | — | |
| UNINEXTtraining_regime=fine-tuning, model_type=specialist2025.03 | 82.2 | — | — | — | — | — | — | — | — | |
| UNINEXT-HText Prompt Encoder=BERT-B (104M), SAM?=false, Training Data=O, C, RC, V2024.06 | 82.2 | — | — | — | — | — | — | — | — | |
| EVF-SAMText Prompt Encoder=BEIT-3 (673M), SAM?=true, Training Data=RC2024.06 | 82.1 | — | — | — | — | — | — | — | — | |
| UniPixelSize=3B2026.01 | 81.9 | — | — | — | — | — | — | — | — | |
| UniLSeg-100Text Prompt Encoder=CLIP-B (63M), SAM?=false, Training Data=SA, RC, gRC2024.06 | 81.7 | — | — | — | — | — | — | — | — | |
| UniLSegModel Version=UniLSeg-100, Model Params=-, RES Train=Y2025.12 | 81.7 | — | — | — | — | — | — | — | — | |
| UniLSeg2026.05 | 81.7 | — | — | — | — | — | — | — | — | |
| Sa2VA2026.05 | 81.6 | — | — | — | — | — | — | — | — | |
| Sa2VA-8BLLM=8B2026.05 | 81.6 | — | — | — | — | — | — | — | — | |
| PaDT ProSize=3B2026.01 | 81.3 | — | — | — | — | — | — | — | — | |
| HiMTok-8Bw/o SMD=false, 1-Token=false, finetuned=false2026.03 | 81.1 | — | — | — | — | — | — | — | — | |
| DETRISModel Version=DETRIS-L, Model Params=-, RES Train=Y2025.12 | 81 | — | — | — | — | — | — | — | — | |
| UFO-8B(ft)w/o SMD=true, 1-Token=false, finetuned=true2026.03 | 81 | — | — | — | — | — | — | — | — | |
| DETRIS2026.05 | 81 | — | — | — | — | — | — | — | — | |
| MLLMSeg2026.05 | 81 | — | — | — | — | — | — | — | — | |
| SimpleSegArchitecture Style=Decoder-free, Pre-training status=true, Backbone=Qwen2.5-VL-7B2026.01 | 80.9 | — | — | — | — | — | — | — | — | |
| Youtu-VL4BBackbone=VL4B2026.05 | 80.7 | — | — | — | — | — | — | — | — | |
| RSAgent-singleModel Version=Qwen2.5, Model Params=7B, RES Train=Y2025.12 | 80.6 | — | — | — | — | — | — | — | — | |
| UGround-7BParameters=7B2025.10 | 80.6 | — | — | — | — | — | — | — | — | |
| UnipixelQwen2.5-VL-3BBackbone=Qwen2.5-VL-3B2026.05 | 80.5 | — | — | — | — | — | — | — | — | |
| u-LLAVAText Prompt Encoder=Vicuna (7B), SAM?=true, Training Data=A, CS, RC, PL, PV2024.06 | 80.4 | — | — | — | — | — | — | — | — | |
| SegLLM-7BParameters=7B2025.10 | 80.2 | — | — | — | — | — | — | — | — | |
| SELF1E-2Bw/o SMD=true, 1-Token=true, finetuned=false2026.03 | 80.2 | — | — | — | — | — | — | — | — | |
| NTP + LLL + SAMEvaluation protocol=Logit Lens, Backbone=Qwen2.5-VL-7B-Instr, Training=NTP + LLL, Post-processing=frozen SAM2026.02 | 80.1 | — | — | — | — | — | — | — | — | |
| SimpleSegArchitecture Style=Decoder-free, Pre-training status=true, Backbone=Kimi-VL2026.01 | 80 | — | — | — | — | — | — | — | — | |
| UFO-8Bw/o SMD=true, 1-Token=false, finetuned=false2026.03 | 80 | — | — | — | — | — | — | — | — | |
| GLEE2026.05 | 80 | — | — | — | — | — | — | — | — | |
| SAM4MLLMModel Version=LLaVA1.6, Model Params=8B, RES Train=Y2025.12 | 79.8 | — | — | — | — | — | — | — | — | |
| SAM4MLLM-8Bw/o SMD=false, finetuned=false2026.03 | 79.8 | — | — | — | — | — | — | — | — | |
| SAM4MLLM2026.05 | 79.8 | — | — | — | — | — | — | — | — | |
| SAM4MLLM-7BType=MLLM-based Segmentation Network, SAM-based=false2024.11 | 79.6 | — | — | — | — | — | — | — | — | |
| SAM4MLLM-7BLLM=7B2026.05 | 79.6 | — | — | — | — | — | — | — | — | |
| GLaMMType=MLLM-based Segmentation Network, SAM-based=true2024.11 | 79.5 | — | — | — | — | — | — | — | — | |
| GLaMMtraining_regime=fine-tuning, model_type=LVLM2025.03 | 79.5 | — | — | — | — | — | — | — | — | |
| GLAMMText Prompt Encoder=Vicuna (7B), SAM?=true, Training Data=G, RC2024.06 | 79.5 | — | — | — | — | — | — | — | — | |
| GLaMMEvaluation protocol=Finetuned-based2026.02 | 79.5 | — | — | — | — | — | — | — | — | |
| GLaMMModel Version=Vicuna, Model Params=7B, RES Train=Y2025.12 | 79.5 | — | — | — | — | — | — | — | — | |
| GLaMM-7BParameters=7B2025.10 | 79.5 | — | — | — | — | — | — | — | — | |
| GLaMMw/o SMD=false, 1-Token=true, finetuned=false2026.03 | 79.5 | — | — | — | — | — | — | — | — | |
| MLLMSegInternVL2.5-4BBackbone=InternVL2.5-4B2026.05 | 79.5 | — | — | — | — | — | — | — | — | |
| GLaMM2026.05 | 79.5 | — | — | — | — | — | — | — | — | |
| POPENFinetuning=true2025.04 | 79.3 | — | — | — | — | — | — | — | — | |
| Text4Seg (w/ SAM)Architecture Style=Decoder-based, Pre-training status=false2026.01 | 79.2 | — | — | — | — | — | — | — | — | |
| GSVAModel Version=LLaVA1.5, Model Params=13B, RES Train=Y2025.12 | 79.2 | — | — | — | — | — | — | — | — | |
| Text4SegInternVL2-8BBackbone=InternVL2-8B2026.05 | 79.2 | — | — | — | — | — | — | — | — | |
| SegAgent+SAMLLaVA-7BBackbone=LLaVA-7B2026.05 | 79.2 | — | — | — | — | — | — | — | — | |
| GSVA2026.05 | 79.2 | — | — | — | — | — | — | — | — | |
| Text4Seg2026.05 | 79.2 | — | — | — | — | — | — | — | — | |
| UniRef++training_regime=fine-tuning, model_type=specialist2025.03 | 79.1 | — | — | — | — | — | — | — | — | |
| UniRef++-LText Prompt Encoder=BERT-B (104M), SAM?=false, Training Data=RC, F, V2024.06 | 79.1 | — | — | — | — | — | — | — | — | |
| GroundHog-7BType=MLLM-based Segmentation Network, SAM-based=false2024.11 | 78.5 | — | — | — | — | — | — | — | — | |
| POPEN2025.04 | 78.5 | — | — | — | — | — | — | — | — | |
| GroundhogArchitecture Style=Decoder-based, Pre-training status=false2026.01 | 78.5 | — | — | — | — | — | — | — | — | |
| GroundHog-7Bw/o SMD=false, 1-Token=false, finetuned=false2026.03 | 78.5 | — | — | — | — | — | — | — | — | |
| MIRASTraining Stage=Stage-1, LLaVA version=v1.62025.02 | 78.4 | — | — | — | — | — | — | — | — | |
| READ-7BParameters=7B2025.10 | 78.1 | — | — | — | — | — | — | — | — | |
| SegAgent-Qwen+SAMEvaluation Protocol=finetuned, Evaluation Subset=full val2026.06 | 78.01 | — | — | — | — | — | — | — | — | |
| OMG-LLaVAType=MLLM-based Segmentation Network, SAM-based=false2024.11 | 78 | — | — | — | — | — | — | — | — | |
| OMG-LLaVA2025.02 | 78 | — | — | — | — | — | — | — | — | |
| OMG-LLaVA2025.10 | 78 | — | — | — | — | — | — | — | — | |
| OMG-LLaVA(ft)w/o SMD=false, 1-Token=true, finetuned=true2026.03 | 78 | — | — | — | — | — | — | — | — | |
| UFOInternVL2-8BBackbone=InternVL2-8B2026.05 | 78 | — | — | — | — | — | — | — | — | |
| GSVA-13Btraining_regime=fine-tuning, model_type=LVLM2025.03 | 77.7 | — | — | — | — | — | — | — | — | |
| GSVA-13BEvaluation protocol=Finetuned-based, Parameters=13B2026.02 | 77.7 | — | — | — | — | — | — | — | — | |
| GSVAFinetuning=true2025.04 | 77.2 | — | — | — | — | — | — | — | — | |
| GSVAArchitecture Style=Decoder-based, Pre-training status=false2026.01 | 77.2 | — | — | — | — | — | — | — | — | |
| UFOLLaVA-1.5-7BArchitecture Style=Decoder-free, Pre-training status=false2026.01 | 77.2 | — | — | — | — | — | — | — | — | |
| GSVA-7Bfine-tuned=true2026.01 | 77.2 | — | — | — | — | — | — | — | — |