Interactive Segmentation on Pascal VOC
1.69NoC@85Ours-ViT-B+MST+CL
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Ours-ViT-B+MST+CLBackbone=ViT-B, MST=true, CL=true, Training Data=COCO [26] and LVIS [27]2024.01 | 1.69 | 1.9 | — | — | — | — | — | — | — | — | — | |
| SimpleClickBackbone=ViT-L, Training Data=COCO+LVIS2022.10 | 1.72 | 1.96 | — | — | — | — | — | — | — | — | — | |
| SimpleClickBackbone=ViT-H, Training Data=COCO+LVIS2022.10 | 1.76 | 1.98 | — | — | — | — | — | — | — | — | — | |
| SimpleClickBackbone=ViT-H, Training Data=SBD2022.10 | 1.88 | 2.2 | — | — | — | — | — | — | — | — | — | |
| PseudoClickBackbone=HRNet-32, Training Data=COCO+LVIS2022.10 | 1.94 | 2.25 | — | — | — | — | — | — | — | — | — | |
| SimpleClickBackbone=ViT-L, Training Data=SBD2022.10 | 1.95 | 2.3 | — | — | — | — | — | — | — | — | — | |
| Ours-ViT-B+MSTBackbone=ViT-B, MST=true, Training Data=COCO [26] and LVIS [27]2024.01 | 2.05 | 2.37 | — | — | — | — | — | — | — | — | — | |
| SimpleClickBackbone=ViT-B, Training Data=COCO+LVIS2022.10 | 2.06 | 2.38 | — | — | — | — | — | — | — | — | — | |
| SimpleClick-ViT-BBackbone=ViT-B, Training Data=COCO [26] and LVIS [27]2024.01 | 2.06 | 2.38 | — | — | — | — | — | — | — | — | — | |
| RITMBackbone=HRNet-32, Training Data=COCO+LVIS2022.10 | 2.19 | 2.57 | — | — | — | — | — | — | — | — | — | |
| SAM-VIT-HBackbone=VIT-H, Training Data=COCO [26] and LVIS [27]2024.01 | 2.2 | 2.68 | — | — | — | — | — | — | — | — | — | |
| RITM-hrnet32Backbone=hrnet32, Training Data=COCO [26] and LVIS [27]2024.01 | 2.21 | 2.59 | — | — | — | — | — | — | — | — | — | |
| RITMBackbone=HRNet-18, Training Dataset=COCO+LVIS, Iterative Mode (IT-M)=true, Number of iterations (Niters)=32021.02 | 2.28 | — | — | — | — | — | — | — | — | — | — | |
| PseudoClickBackbone=HRNet-18, Training Data=SBD2022.10 | 2.34 | 2.74 | — | — | — | — | — | — | — | — | — | |
| SimpleClickBackbone=ViT-B, Training Data=SBD2022.10 | 2.38 | 2.81 | — | — | — | — | — | — | — | — | — | |
| FocalClickBackbone=SegF-B3, Training Data=COCO+LVIS2022.10 | 2.46 | 2.88 | — | — | — | — | — | — | — | — | — | |
| EdgeFlow2021.09 | 2.5 | — | — | — | — | — | — | — | — | — | — | |
| HQ-SAM-VIT-HBackbone=VIT-H, Training Data=COCO [26] and LVIS [27]2024.01 | 2.5 | 2.93 | — | — | — | — | — | — | — | — | — | |
| RITMBackbone=HRNet-18, Training Dataset=SBD, Iterative Mode (IT-M)=true, Number of iterations (Niters)=32021.02 | 2.51 | — | — | — | — | — | — | — | — | — | — | |
| RITMBackbone=HRNet-18, Training Data=SBD2022.10 | 2.51 | 3.03 | — | — | — | — | — | — | — | — | — | |
| FocalClick-segformer-B3-S2Backbone=segformer-B3-S2, Training Data=COCO [26] and LVIS [27]2024.01 | 2.53 | 2.97 | — | — | — | — | — | — | — | — | — | |
| DC-TTABackbone=ViT-B, Input Resolution=1024x1024, Max Clicks=202025.06 | 2.54 | 2.99 | — | — | — | — | — | — | 1.08 | 1.99 | — | |
| RITMBackbone=HRNet-18s, Training Dataset=COCO+LVIS, Iterative Mode (IT-M)=true, Number of iterations (Niters)=32021.02 | 2.57 | — | — | — | — | — | — | — | — | — | — | |
| RITMBackbone=HRNet-32, Training Dataset=COCO+LVIS, Iterative Mode (IT-M)=true, Number of iterations (Niters)=32021.02 | 2.57 | — | — | — | — | — | — | — | — | — | — | |
| RITM-hrnet18sBackbone=hrnet18s, Training Data=COCO [26] and LVIS [27]2024.01 | 2.57 | — | — | — | — | — | — | — | — | — | — | |
| RITMBackbone=HRNet-18, Training Dataset=COCO+LVIS, Iterative Mode (IT-M)=false2021.02 | 2.59 | — | — | — | — | — | — | — | — | — | — | |
| RITM-H18Backbone=HRNet-182021.09 | 2.59 | — | — | — | — | — | — | — | — | — | — | |
| DC-onlyBackbone=ViT-B, Input Resolution=1024x1024, Max Clicks=202025.06 | 2.59 | 3.06 | — | — | — | — | — | — | 1.55 | 2.63 | — | |
| AdaptSAMBackbone=ViT-B, Input Resolution=1024x1024, Max Clicks=202025.06 | 2.62 | 3.08 | — | — | — | — | — | — | 1.7 | 2.69 | — | |
| BaselineBackbone=ViT-B, Input Resolution=1024x1024, Max Clicks=202025.06 | 2.64 | 3.12 | — | — | — | — | — | — | 1.81 | 3.04 | — | |
| TENTBackbone=ViT-B, Input Resolution=1024x1024, Max Clicks=202025.06 | 2.64 | 3.11 | — | — | — | — | — | — | 1.81 | 2.99 | — | |
| FCA-Net (SIS)2021.02 | 2.69 | — | — | — | — | — | — | — | — | — | — | |
| FCA2021.09 | 2.69 | — | — | — | — | — | — | — | — | — | — | |
| CDNetBackbone=ResNet-34, Training Data=COCO+LVIS2022.10 | 2.74 | 3.3 | — | — | — | — | — | — | — | — | — | |
| RITMBackbone=HRNet-18, Training Dataset=SBD, Iterative Mode (IT-M)=false2021.02 | 2.94 | — | — | — | — | — | — | — | — | — | — | |
| FocalClickBackbone=SegF-B0, Training Data=COCO+LVIS2022.10 | 2.97 | 3.52 | — | — | — | — | — | — | — | — | — | |
| IA+SA2021.02 | 3.18 | — | — | — | — | — | — | — | — | — | — | |
| IA+SA2021.09 | 3.18 | — | — | — | — | — | — | — | — | — | — | |
| FocalClick-segformer-B0-S2Backbone=segformer-B0-S2, Training Data=COCO [26] and LVIS [27]2024.01 | 3.55 | 4.24 | — | — | — | — | — | — | — | — | — | |
| CDNetBackbone=ResNet-34, Training Data=SBD2022.10 | 3.61 | 4.51 | — | — | — | — | — | — | — | — | — | |
| CAG2021.02 | 3.62 | — | — | — | — | — | — | — | — | — | — | |
| CAG2021.09 | 3.62 | — | — | — | — | — | — | — | — | — | — | |
| ITIS2021.02 | 3.8 | — | — | — | — | — | — | — | — | — | — | |
| ITIS2021.09 | 3.8 | — | — | — | — | — | — | — | — | — | — | |
| RIS-Net2021.02 | 5.12 | — | — | — | — | — | — | — | — | — | — | |
| RIS-Net2021.09 | 5.12 | — | — | — | — | — | — | — | — | — | — | |
| DIOS with GC2021.02 | 6.88 | — | — | — | — | — | — | — | — | — | — | |
| DOS2021.09 | 6.88 | — | — | — | — | — | — | — | — | — | — | |
| DIOSBackbone=FCN, Training Data=Pascal VOC2022.10 | — | 6.88 | — | — | — | — | — | — | — | — | — | |
| FCA-NetBackbone=ResNet-101, Training Data=Pascal VOC2022.10 | — | 2.69 | — | — | — | — | — | — | — | — | — | |
| FocalClick (B)Task Category=Interactive, Training Data=COCO (0.12M)2023.04 | — | — | 2.25 | 2.19 | 1.84 | 2.88 | 1.76 | 1.83 | — | — | — | |
| FocalClick (T)Task Category=Interactive, Training Data=COCO (0.12M)2023.04 | — | — | 1.94 | 1.94 | 1.67 | 2.46 | 1.64 | 1.64 | — | — | — | |
| Gen2SegZero-shot=true, Training Data=Synthetic2026.06 | — | — | — | — | — | — | — | — | — | — | 39.4 | |
| MAE-HZero-shot=true, Training Data=Synthetic2026.06 | — | — | — | — | — | — | — | — | — | — | 37 | |
| Prompt2SegZero-shot=true, Training Data=Synthetic2026.06 | — | — | — | — | — | — | — | — | — | — | 42.4 | |
| Prompt2Seg-AdapterZero-shot=true, Training Data=Synthetic2026.06 | — | — | — | — | — | — | — | — | — | — | 39 | |
| Prompt2Seg-ConcatZero-shot=true, Training Data=Synthetic2026.06 | — | — | — | — | — | — | — | — | — | — | 32.1 | |
| PseudoClick (<T)Task Category=Interactive, Training Data=COCO (0.12M)2023.04 | — | — | 2.57 | 1.93 | 1.64 | 3.52 | 2.38 | 1.98 | — | — | — | |
| RITM (<T)Task Category=Interactive, Training Data=COCO+LVIS (0.12M)2023.04 | — | — | 2.19 | 1.75 | 1.52 | 2.97 | 2.19 | 1.83 | — | — | — | |
| SAMZero-shot=true, Backbone=ViT-H, Training Data=SA-1B2026.06 | — | — | — | — | — | — | — | — | — | — | 45.5 | |
| SAM (B)Task Category=Generalist, Training Data=SAM (11M)2023.04 | — | — | 2.47 | 2.65 | 3.28 | 2.23 | 3.13 | 4.12 | — | — | — | |
| SAM (H)Task Category=Generalist, Training Data=SAM (11M)2023.04 | — | — | 1.82 | 2.13 | 2.55 | 1.98 | 2.43 | 3.11 | — | — | — | |
| SAM (L)Task Category=Generalist, Training Data=SAM (11M)2023.04 | — | — | 1.85 | 2.15 | 2.6 | 2.01 | 2.46 | 3.12 | — | — | — | |
| SEEM (B)Task Category=Generalist, Training Data=COCO+LVIS (0.12M), Backbone=DaViT-d3 (B)2023.04 | — | — | 1.56 | 2.04 | 2.93 | 1.77 | 2.47 | 3.79 | — | — | — | |
| SEEM (B)Task Category=Composition, Training Data=COCO+LVIS (0.12M), Backbone=DaViT-d3 (B)2023.04 | — | — | 1.56 | 2.03 | 2.91 | 1.77 | 2.46 | 3.76 | — | — | — | |
| SEEM (L)Task Category=Generalist, Training Data=COCO+LVIS (0.12M), Backbone=DaViT-d5 (L)2023.04 | — | — | 1.51 | 1.95 | 2.77 | 1.71 | 2.36 | 3.61 | — | — | — | |
| SEEM (L)Task Category=Composition, Training Data=COCO+LVIS (0.12M), Backbone=DaViT-d5 (L)2023.04 | — | — | 1.52 | 1.97 | 2.81 | 1.72 | 2.38 | 3.64 | — | — | — | |
| SEEM (T)Task Category=Generalist, Training Data=COCO+LVIS (0.12M), Backbone=FocalT2023.04 | — | — | 1.72 | 2.3 | 3.37 | 1.97 | 2.83 | 4.41 | — | — | — | |
| SEEM (T)Task Category=Composition, Training Data=COCO+LVIS (0.12M), Backbone=FocalT2023.04 | — | — | 1.72 | 2.28 | 3.32 | 1.97 | 2.82 | 4.37 | — | — | — | |
| SimpleClickZero-shot=true, Backbone=ViTDet, Training Data=Synthetic2026.06 | — | — | — | — | — | — | — | — | — | — | 42.3 | |
| SimpleClick (B)Task Category=Interactive, Training Data=COCO+LVIS (0.12M)2023.04 | — | — | 2.97 | 2.38 | 1.96 | 3.52 | 1.98 | 1.98 | — | — | — | |
| SimpleClick (L)Task Category=Interactive, Training Data=COCO+LVIS (0.12M)2023.04 | — | — | 2.46 | 1.52 | 1.51 | 2.88 | 1.64 | 1.64 | — | — | — |