Interactive Segmentation on GrabCut
1.2NoC@90GraCo w/ GT+AGG
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GraCo w/ GT+AGGBackbone=ViT-L, Granularity Type=Granularity-Controllable, Granularity control input=GT+AGG, Selection Strategy=Optimal granularity (0 to 1, step 0.1)2024.05 | 1.2 | 1.18 | — | |
| GraCo w/ AGGBackbone=ViT-L, Granularity Type=Granularity-Controllable, Granularity control input=AGG, Selection Strategy=Optimal granularity (0 to 1, step 0.1)2024.05 | 1.24 | 1.18 | — | |
| FocalClick-segformerB3-S2Train Data=Large Dataset [2,7,13,24,26,39,45,48], Backbone=segformerB32022.04 | 1.26 | 1.22 | — | |
| FocSAM-ViT-HBackbone=ViT-H2024.05 | 1.32 | — | 0.39 | |
| FocalClick-hrnet32-S2Train Data=Large Dataset [2,7,13,24,26,39,45,48], Backbone=hrnet322022.04 | 1.34 | 1.3 | — | |
| GraCo w/ GT+AGGBackbone=ViT-B, Granularity Type=Granularity-Controllable, Granularity control input=GT+AGG, Selection Strategy=Optimal granularity (0 to 1, step 0.1)2024.05 | 1.36 | 1.24 | — | |
| InterFormer-TinyModel Size=Tiny2024.05 | 1.36 | — | 0.23 | |
| InterFormer-TinyBackbone=ViT-L, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 1.36 | — | — | |
| SimpleClickBackbone=ViT-L, Training Data=COCO+LVIS2022.10 | 1.4 | 1.32 | — | |
| SimpleClick-ViT-LBackbone=ViT-L2024.05 | 1.4 | — | 3.12 | |
| CFR-ICLBackbone=ViT-H, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 1.42 | — | — | |
| SimpleClickBackbone=ViT-H, Training Data=SBD2022.10 | 1.44 | 1.32 | — | |
| SimpleClickBackbone=ViT-H, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 1.44 | 1.32 | — | |
| SimpleClickBackbone=ViT-L, Training Data=SBD2022.10 | 1.46 | 1.38 | — | |
| FCFIBackbone=HRNet-18, Train set=COCO+LVIS2023.03 | 1.46 | 1.38 | — | |
| SimpleClickBackbone=ViT-L, Granularity Type=Single-granularity2024.05 | 1.46 | 1.38 | — | |
| GraCo w/ AGGBackbone=ViT-B, Granularity Type=Granularity-Controllable, Granularity control input=AGG, Selection Strategy=Optimal granularity (0 to 1, step 0.1)2024.05 | 1.46 | 1.34 | — | |
| SimpleClickBackbone=ViT-B, Training Data=COCO+LVIS2022.10 | 1.48 | 1.38 | — | |
| SimpleClick-ViT-BBackbone=ViT-B, Training Data=COCO [26] and LVIS [27]2024.01 | 1.48 | — | — | |
| Ours-ViT-B+MST+CLBackbone=ViT-B, MST=true, CL=true, Training Data=COCO [26] and LVIS [27]2024.01 | 1.48 | — | — | |
| SimpleClick-ViT-BBackbone=ViT-B2024.05 | 1.48 | — | 1.26 | |
| CPlotBackbone=ViT-B, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 1.48 | 1.34 | — | |
| FocalClick-segformerB3-S2Train Data=COCO [26]+LVIS [13], Backbone=segformerB32022.04 | 1.5 | 1.44 | — | |
| PseudoClickBackbone=HRNet-32, Training Data=COCO+LVIS2022.10 | 1.5 | 1.36 | — | |
| FocalClickBackbone=SegF-B3, Training Data=COCO+LVIS2022.10 | 1.5 | 1.44 | — | |
| SimpleClickBackbone=ViT-H, Training Data=COCO+LVIS2022.10 | 1.5 | 1.38 | — | |
| PseudoClick-HR32Backbone=HR322024.05 | 1.5 | — | — | |
| FocalClick-SegFB3-S2Backbone=SegFB3, Model Config=S22024.05 | 1.5 | — | 0.1 | |
| InterFormer-LightModel Size=Light2024.05 | 1.5 | — | 0.13 | |
| SimpleClick-ViT-HBackbone=ViT-H2024.05 | 1.5 | — | 6.99 | |
| CDNetBackbone=ResNet-34, Training Data=COCO+LVIS2022.10 | 1.52 | 1.4 | — | |
| Ours-ViT-B+MSTBackbone=ViT-B, MST=true, Training Data=COCO [26] and LVIS [27]2024.01 | 1.52 | — | — | |
| CDNet-R34Backbone=ResNet-342024.05 | 1.52 | — | — | |
| RITMBackbone=HRNet-18, Training Dataset=COCO+LVIS, Iterative Mode (IT-M)=true, Number of iterations (Niters)=32021.02 | 1.54 | 1.42 | — | |
| SimpleClickBackbone=ViT-B, Training Data=SBD2022.10 | 1.54 | 1.4 | — | |
| RITMBackbone=HRNet-18, Train set=COCO+LVIS2023.03 | 1.54 | 1.42 | — | |
| RITMBackbone=HRNet-18, Training Dataset=COCO+LVIS2022.03 | 1.54 | — | — | |
| SimpleClickBackbone=ViT-B, Granularity Type=Single-granularity2024.05 | 1.54 | 1.4 | — | |
| SimpleClickBackbone=ViT-B, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 1.54 | 1.4 | — | |
| RITMBackbone=HRNet-32, Training Dataset=COCO+LVIS, Iterative Mode (IT-M)=true, Number of iterations (Niters)=32021.02 | 1.56 | 1.46 | — | |
| RITM-hrnet32Train Data=COCO [26]+LVIS [13], Backbone=hrnet322022.04 | 1.56 | 1.46 | — | |
| RITMBackbone=HRNet-32, Training Data=COCO+LVIS2022.10 | 1.56 | 1.46 | — | |
| FCFIBackbone=HRNet-18s, Train set=COCO+LVIS2023.03 | 1.56 | 1.5 | — | |
| RITM-hrnet32Backbone=hrnet32, Training Data=COCO [26] and LVIS [27]2024.01 | 1.56 | — | — | |
| RITM-HR32Backbone=HR322024.05 | 1.56 | — | — | |
| FocalClick-hrnet18s-S2Train Data=COCO [26]+LVIS [13], Backbone=hrnet18s2022.04 | 1.62 | 1.48 | — | |
| SAM-VIT-HBackbone=VIT-H, Training Data=COCO [26] and LVIS [27]2024.01 | 1.62 | — | — | |
| FocalClick-HR18S-S2Backbone=HR18S, Model Config=S22024.05 | 1.62 | — | 0.07 | |
| FocusCutBackbone=ResNet-101, Training Data=SBD2022.10 | 1.64 | 1.46 | — | |
| FocusCutBackbone=ResNet-101, Train set=SBD2023.03 | 1.64 | 1.46 | — | |
| FocusCutBackbone=ResNet-101, Training Dataset=SBD2022.03 | 1.64 | — | — | |
| FocusCutBackbone=ResNet-101, Granularity Type=Single-granularity2024.05 | 1.64 | 1.46 | — | |
| GraCo w/ GTBackbone=ViT-B, Granularity Type=Granularity-Controllable, Granularity control input=GT, Selection Strategy=Optimal granularity (0 to 1, step 0.1)2024.05 | 1.64 | 1.46 | — | |
| FocalClick-segformerB0-S2Train Data=COCO [26]+LVIS [13], Backbone=segformerB02022.04 | 1.66 | 1.4 | — | |
| FocalClickBackbone=SegF-B0, Training Data=COCO+LVIS2022.10 | 1.66 | 1.4 | — | |
| FocalClick-S2Backbone=HRNet-18s, Train set=COCO+LVIS2023.03 | 1.66 | 1.52 | — | |
| FocalClick-SegFB0-S2Backbone=SegFB0, Model Config=S22024.05 | 1.66 | — | 0.02 | |
| RITMBackbone=HRNet-18s, Training Dataset=COCO+LVIS, Iterative Mode (IT-M)=true, Number of iterations (Niters)=32021.02 | 1.68 | 1.54 | — | |
| RITM-hrnet18sTrain Data=COCO [26]+LVIS [13], Backbone=hrnet18s2022.04 | 1.68 | 1.54 | — | |
| RITMBackbone=HRNet-18s, Train set=COCO+LVIS2023.03 | 1.68 | 1.54 | — | |
| CSFPNBackbone=HRNet-18, Training Dataset=COCO+LVIS2022.03 | 1.68 | — | — | |
| RITM-hrnet18sBackbone=hrnet18s, Training Data=COCO [26] and LVIS [27]2024.01 | 1.68 | — | — | |
| FocalClick-segformer-B3-S2Backbone=segformer-B3-S2, Training Data=COCO [26] and LVIS [27]2024.01 | 1.68 | — | — | |
| SAMBackbone=ViT-B, Granularity Type=Multi-granularity, Prediction selection strategy=Best matching result from multiple predictions2024.05 | 1.68 | 1.56 | — | |
| RITM-HR18sBackbone=HR18s2024.05 | 1.68 | — | — | |
| f-BRS-B-hrnet32Train Data=COCO [26]+LVIS [13], Backbone=hrnet322022.04 | 1.69 | 1.54 | — | |
| f-BRS-B-hrnet32Backbone=hrnet32, Training Data=COCO [26] and LVIS [27]2024.01 | 1.69 | — | — | |
| f-BRS-B-HR32Backbone=HR322024.05 | 1.69 | — | — | |
| RITMBackbone=HRNet-18, Training Dataset=COCO+LVIS, Iterative Mode (IT-M)=false2021.02 | 1.7 | 1.54 | — | |
| RITM-H18Backbone=HRNet-182021.09 | 1.7 | 1.54 | — | |
| EdgeFlow2021.09 | 1.72 | 1.6 | — | |
| EdgeFlow-hrnet18Train Data=COCO [26]+LVIS [13], Backbone=hrnet182022.04 | 1.72 | 1.6 | — | |
| EdgeFlowBackbone=HRNet-18, Train set=COCO+LVIS2023.03 | 1.72 | 1.6 | — | |
| EdgeFlow-hrnet18Backbone=hrnet18, Training Data=COCO [26] and LVIS [27]2024.01 | 1.72 | — | — | |
| EdgeFlow-HR18Backbone=HR182024.05 | 1.72 | — | — | |
| CSFPNBackbone=HRNet-18, Training Dataset=SBD2022.03 | 1.75 | — | — | |
| FocusCutBackbone=ResNet-50, Training Data=SBD2022.10 | 1.78 | 1.6 | — | |
| FocusCutBackbone=ResNet-50, Training Dataset=SBD2022.03 | 1.78 | — | — | |
| 99% Accuracy NetTrain Data=Synthetic [8, 15, 26, 43]2022.04 | 1.8 | — | — | |
| FocalClick-hrnet32-S2Train Data=COCO [26]+LVIS [13], Backbone=hrnet322022.04 | 1.8 | 1.64 | — | |
| FCFIBackbone=ResNet-101, Train set=SBD2023.03 | 1.8 | 1.64 | — | |
| FocalClickBackbone=HRNet-32, Training Dataset=COCO+LVIS2022.03 | 1.8 | — | — | |
| FocalClick-HR32-S2Backbone=HR32, Model Config=S22024.05 | 1.8 | — | 0.14 | |
| FocalClick-hrnet18s-S1Train Data=COCO [26]+LVIS [13], Backbone=hrnet18s2022.04 | 1.82 | 1.64 | — | |
| GPCISBackbone=ResNet-50, Granularity Type=Single-granularity2024.05 | 1.82 | 1.64 | — | |
| FocalClick-HR18S-S1Backbone=HR18S, Model Config=S12024.05 | 1.82 | — | 0.03 | |
| SAMBackbone=ViT-H, Training Dataset=SBD2022.03 | 1.84 | — | — | |
| HQ-SAM-VIT-HBackbone=VIT-H, Training Data=COCO [26] and LVIS [27]2024.01 | 1.84 | — | — | |
| PseudoClickBackbone=HRNet-32, Granularity Type=Single-granularity2024.05 | 1.84 | — | — | |
| FocalClick-segformerB0-S1Train Data=COCO [26]+LVIS [13], Backbone=segformerB02022.04 | 1.86 | 1.6 | — | |
| FocalClick-SegFB0-S1Backbone=SegFB0, Model Config=S12024.05 | 1.86 | — | 0.01 | |
| GraCo w/ GTBackbone=ViT-L, Granularity Type=Granularity-Controllable, Granularity control input=GT, Selection Strategy=Optimal granularity (0 to 1, step 0.1)2024.05 | 1.88 | 1.74 | — | |
| SAM-ViT-HBackbone=ViT-H, Conventional COCO+LVIS training=false2024.05 | 1.88 | — | 0.35 | |
| FocalClick-segformerB0-S2Train Data=SBD [15], Backbone=segformerB02022.04 | 1.9 | 1.66 | — | |
| FocalClickBackbone=SegF-B0, Training Data=SBD2022.10 | 1.9 | 1.66 | — | |
| FocalClick-segformer-B0-S2Backbone=segformer-B0-S2, Training Data=COCO [26] and LVIS [27]2024.01 | 1.9 | — | — | |
| FocalClickBackbone=MiT-B0, Granularity Type=Single-granularity2024.05 | 1.9 | 1.66 | — | |
| FocalClickBackbone=SegFormerB0-S2, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 1.9 | — | — | |
| M2N2 (Ours)Backbone=SD2, Supervision=Unsupervised: Training-Free2024.11 | 1.9 | 1.62 | — | |
| SAMBackbone=ViT-L, Granularity Type=Multi-granularity, Prediction selection strategy=Best matching result from multiple predictions2024.05 | 1.92 | 1.72 | — |