Reasoning Segmentation on ReasonSeg (val)
79.3gIoUVision Banana
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Vision BananaZero-Shot Transfer=true, MLLM=Gemini 2.5 Pro2026.04 | 79.3 | — | — | — | |
| Vision BananaMLLM=Gemini 2.5 Pro, Zero-Shot Transfer=true2026.04 | 79.3 | — | — | — | |
| SAM 3 AgentMLLM=Gemini 2.5 Pro, fine-tuned on ReasonSeg (train)=false2025.11 | 77 | — | — | — | |
| SAM 3 AgentZero-Shot Transfer=true, MLLM=Gemini 2.5 Pro2026.04 | 77 | — | — | — | |
| SAM 3 AgentMLLM=Gemini 2.5 Pro, Zero-Shot Transfer=true2026.04 | 77 | — | — | — | |
| SAM 3 AgentVersion=Qwen2.5-VL 72B, Training-RES=false, Training-ReasonSeg=false2025.12 | 74.6 | 65.1 | — | — | |
| SAM 3 AgentMLLM=Qwen2.5-VL 72B, fine-tuned on ReasonSeg (train)=false2025.11 | 74.6 | — | — | — | |
| Seg-ReSearch-8BNumber of parameters=8B2026.02 | 73.3 | 72.2 | — | — | |
| Seg-ReSearch-8B2026.04 | 73.3 | 72.2 | — | — | |
| ResAgentSize=4B2026.01 | 72.74 | 68.38 | — | — | |
| VisHarness2026.05 | 72.4 | 62.4 | — | — | |
| SAM-VeteranVersion=Qwen2.5-VL 32B, Training-RES=true, Training-ReasonSeg=true2025.12 | 72.3 | 70 | — | — | |
| IC-Seg-8BParameters=8B2026.05 | 72.3 | 74.6 | — | — | |
| CR-SegMethod Category=Internal-Representation-Based Reasoning Segmentation (IRS)2026.06 | 70.8 | 66.8 | — | — | |
| EVOL-SAM3Version=Qwen2.5-VL 7B, Training-RES=false, Training-ReasonSeg=false2025.12 | 70.7 | 63.4 | — | — | |
| Qwen3-VL-8B*Parameters=8B2026.05 | 70.6 | 71.2 | — | — | |
| ResAgentSize=8B2026.01 | 70.51 | 66.86 | — | — | |
| Qwen3-VL-8B*Number of parameters=8B2026.02 | 70.3 | 70 | — | — | |
| Qwen3-VL-8B2026.04 | 70.3 | 70 | — | — | |
| VisHarness-SFTMode=SFT2026.05 | 69.9 | 62 | — | — | |
| DGSegMLLM=Qwen2.5-VL-7B, setting=zero-shot2026.07 | 69.6 | 65.5 | — | — | |
| RSAgentModel Version=Qwen2.5-VL, Params=7B, RES Training=true, ReasonSeg Training=false2025.12 | 69 | 68.3 | — | — | |
| DR2SegLanguage Model=Qwen2.5VL-7B, Trained on ReasonSeg train split=true2026.01 | 68.5 | 65.8 | 26.9 | — | |
| SAM 3 AgentVersion=Llama4 Maverick, Training-RES=false, Training-ReasonSeg=false2025.12 | 68.5 | 61.5 | — | — | |
| SAM 3 AgentMLLM=Llama4 Maverick, fine-tuned on ReasonSeg (train)=false2025.11 | 68.5 | — | — | — | |
| Dr. SegMethod Category=Explicit-Prompt-Based Reasoning Segmentation (ERS), Experimental Condition=Independent experiments under the same experimental conditions2026.06 | 68.4 | 61.2 | — | — | |
| Rea2SegModel=Qwen2.5-VL-3B, Selection=Top 32026.06 | 68.4 | 70 | — | — | |
| AnchorSeg-7B-LLaVA1.5Fine-tuned (ft)=true2026.04 | 68.3 | 75.9 | — | — | |
| SAM-VeteranVersion=Qwen2.5-VL 7B, Training-RES=true, Training-ReasonSeg=true2025.12 | 68.2 | 67.3 | — | — | |
| SAM-VeteranMLLM=Qwen2.5-VL-7B, setting=zero-shot2026.07 | 68.2 | 67.3 | — | — | |
| UGround-13B-LLaVA1.5 (ft)Backbone=LLaVA1.5, Model Size=13B, Fine-tuned=true2025.10 | 67.9 | 74.9 | — | — | |
| AnchorSeg-13B-LLaVA1.5Fine-tuned (ft)=true2026.04 | 67.9 | 73 | — | — | |
| Dr. SegMethod Category=Explicit-Prompt-Based Reasoning Segmentation (ERS), Experimental Condition=Reproduced using LoRA fine-tuning on Qwen3-VL-4B and SAM32026.06 | 67.6 | 58.3 | — | — | |
| DR2SegLanguage Model=Qwen2.5VL-7B, Trained on ReasonSeg train split=false2026.01 | 67.5 | 60 | 46.2 | — | |
| Rea2SegModel=LLaVA-v1.5-7B, Selection=Top 32026.06 | 67.5 | 60.2 | — | — | |
| Ours (multi-object)consistent-checkpoint=true2026.05 | 67.48 | — | — | — | |
| SegCompass-13BBackbone=LLaVA-1.5, Zero-shot=true2026.05 | 67.4 | 67.2 | — | — | |
| Ours (single-object)zero-shot=true2026.05 | 66.99 | — | — | — | |
| EVOL-SAM3Version=Qwen2.5-VL 3B, Training-RES=false, Training-ReasonSeg=false2025.12 | 66.9 | 57.1 | — | — | |
| GELLA2024.02 | 66.7 | 74.3 | — | — | |
| SegCompass-7BBackbone=Qwen2.5-VL, Zero-shot=true2026.05 | 66.6 | 66.3 | — | — | |
| ViSurf (Qwen2.5VL-7B + SAM2)Backbone=Qwen2.5VL-7B, Segmentation Model=SAM22025.10 | 66.5 | — | — | — | |
| VisionReasonerLanguage Model=Qwen2.5VL-7B, Trained on ReasonSeg train split=false2026.01 | 66.3 | 59.8 | 80.8 | — | |
| VisionReasoner-7BBackbone=7B2025.10 | 66.3 | — | — | — | |
| VisionReasoner-7Bconsistent-checkpoint=true2026.05 | 66.3 | — | — | — | |
| VisionReasoner-7BYear=2025, Backbone=Qwen2.5-VL, Zero-shot=true2026.05 | 66.3 | — | — | — | |
| SegCompass-7BBackbone=LLaVA-1.5, Zero-shot=true2026.05 | 66.3 | 65.6 | — | — | |
| UGround-7B-LLaVA1.5 (ft)Backbone=LLaVA1.5, Model Size=7B, Fine-tuned=true2025.10 | 66.1 | 72.1 | — | — | |
| DGSegMLLM=Qwen2.5-VL-3B, setting=zero-shot2026.07 | 66 | 58.3 | — | — | |
| SELF1E-8B2026.03 | 65.9 | 69.7 | — | — | |
| VisionReasonerMethod Category=Explicit-Prompt-Based Reasoning Segmentation (ERS), Experimental Condition=Independent experiments under the same experimental conditions2026.06 | 65.8 | 55 | — | — | |
| GLAMM2024.02 | 65.5 | 73.2 | — | — | |
| SAM3-Agent-7BNumber of parameters=7B2026.02 | 65.4 | 50.5 | — | — | |
| VisionReasonerLanguage Model=Qwen2.5VL-7B, Trained on ReasonSeg train split=true2026.01 | 65.4 | 60.3 | 85.3 | — | |
| SAM3-AgentModel Version=Qwen2.5-VL, Params=7B, RES Training=false, ReasonSeg Training=false2025.12 | 65.4 | 50.5 | — | — | |
| SAM3-Agent-7BParameters=7B2026.05 | 65.4 | 50.5 | — | — | |
| SAM3 AgentMLLM=Qwen2.5-VL-7B, setting=zero-shot2026.07 | 65.4 | 50.5 | — | — | |
| CoPRS-7BModel Type=Positional Prior, Evaluation Mode=Zero-shot2025.10 | 65.2 | 64.5 | — | — | |
| SA2VA-8BModel Architecture Category=End-to-end Model, Fine-tuned=false2026.05 | 65.2 | 61.1 | — | — | |
| CoPRSMLLM=Qwen2.5-VL-7B, setting=zero-shot2026.07 | 65.2 | 64.5 | — | — | |
| LISABase Model=LLaVA v1.5, Model Scale=13B, Fine-tuning (ft)=true2023.08 | 65 | 72.9 | — | — | |
| LISA-13B-LLaVA1.5Finetune=true2024.06 | 65 | 72.9 | — | — | |
| LISAVersion=LLaVA1.5 13B, Training-RES=true, Training-ReasonSeg=true2025.12 | 65 | 72.9 | — | — | |
| LISA-13B-LLaVA1.5(ft)Backbone=LLaVA1.5, Model Size=13B, Fine-tuned=true, Reference=Lai et al., 20242025.10 | 65 | 72.9 | — | — | |
| LISA-13B-LLaVA1.5fine-tuned on ReasonSeg (train)=true2025.11 | 65 | — | — | — | |
| LISA-13B-LLaVA1.5Fine-tuned (ft)=true2026.04 | 65 | 72.9 | — | — | |
| LISA-13B-LLaVA1.5Zero-Shot Transfer=false2026.04 | 65 | — | — | — | |
| LISA-13B-LLaVA1.5Zero-Shot Transfer=false2026.04 | 65 | — | — | — | |
| LISA2024.02 | 65 | 72.9 | — | — | |
| HRSegVersion=LLaVA1.6 7B, Training-RES=true, Training-ReasonSeg=true2025.12 | 64.9 | 63.1 | — | — | |
| RSVPVersion=GPT-4o, Training-RES=false, Training-ReasonSeg=false2025.12 | 64.7 | 63.1 | — | — | |
| RSVPModel Version=GPT-4o, RES Training=false, ReasonSeg Training=false2025.12 | 64.7 | 63.1 | — | — | |
| RSVP-GPTReference=Lu et al., 20252025.10 | 64.7 | 63.1 | — | — | |
| RSVPMLLM=GPT-4o, fine-tuned on ReasonSeg (train)=true2025.11 | 64.7 | — | — | — | |
| RSVP-GPT2026.04 | 64.7 | 63.1 | — | — | |
| RSVPZero-Shot Transfer=true, MLLM=GPT-4o2026.04 | 64.7 | — | — | — | |
| RSVPMLLM=GPT-4o, Zero-Shot Transfer=true2026.04 | 64.7 | — | — | — | |
| RSVPMethod Category=Explicit-Prompt-Based Reasoning Segmentation (ERS)2026.06 | 64.7 | 63.1 | — | — | |
| ConceptSeg-R1-7Bfine-tuned=false2026.05 | 64.4 | 55.1 | — | — | |
| LISA++-7B-LLaVA1.5 (ft)Backbone=LLaVA1.5, Model Size=7B, Fine-tuned=true, Reference=Yang et al., 20232025.10 | 64.2 | 68.1 | — | — | |
| LISA++-7B-LLaVA1.5Fine-tuned (ft)=true2026.04 | 64.2 | 68.1 | — | — | |
| LISA++-7BModel Architecture Category=End-to-end Model, Fine-tuned=true2026.05 | 64.2 | 68.1 | — | — | |
| SAM-R1-7BNumber of parameters=7B2026.02 | 64 | 55.8 | — | — | |
| SAM-R1Language Model=Qwen2.5VL-7B, Trained on ReasonSeg train split=false2026.01 | 64 | 55.8 | — | — | |
| SAM-R1Model Version=Qwen2.5-VL, Params=7B, RES Training=true, ReasonSeg Training=false2025.12 | 64 | 55.8 | — | — | |
| SAM-R1-7BParameters=7B2026.05 | 64 | 55.8 | — | — | |
| SAM-R1-7BPublication=NeurIPS’252026.05 | 64 | 55.8 | — | — | |
| SAM-R1-7BYear=2025, Backbone=Qwen2.5-VL, Zero-shot=true2026.05 | 64 | 55.8 | — | — | |
| SAM-R1Model=Qwen2.5-VL-7B2026.06 | 64 | 55.8 | — | — | |
| Rea2SegModel=Qwen2.5-VL-3B, Selection=Top 12026.06 | 64 | 65.6 | — | — | |
| PixelThinkLanguage Model=Qwen2.5VL-7B, Trained on ReasonSeg train split=false2026.01 | 63.8 | 62.6 | 46.9 | — | |
| PIXELTHINKMLLM=Qwen2.5-VL-7B, setting=zero-shot2026.07 | 63.8 | 62.7 | — | — | |
| DPAD-7B2026.03 | 63.1 | 61.2 | — | — | |
| DPAD-7BPublication=CVPR’262026.05 | 63.1 | 61.2 | — | — | |
| LENSMethod Category=Internal-Representation-Based Reasoning Segmentation (IRS), Experimental Condition=Independent experiments under the same experimental conditions2026.06 | 63.1 | 62.6 | — | — | |
| ConceptSeg-R1-3Bfine-tuned=false2026.05 | 62.8 | 54 | — | — | |
| Seg-Zero-7BNumber of parameters=7B2026.02 | 62.6 | 62 | — | — | |
| Seg-ZeroVersion=Qwen2.5-VL 7B, Training-RES=true, Training-ReasonSeg=false2025.12 | 62.6 | 62 | — | — | |
| Seg-ZeroModel Version=Qwen2.5-VL, Params=7B, RES Training=true, ReasonSeg Training=false2025.12 | 62.6 | 62 | — | — | |
| Seg-Zero-7Bsource=reported in original paper2026.03 | 62.6 | 62 | — | — |