Interactive Segmentation on Berkeley
1.38NoC@90AdaptiveClick
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| AdaptiveClickTrain data=COCO+LVIS, Backbone=VIT-H, Fusion Strategy=Early Fusion2024.08 | 1.38 | — | — | — | — | — | |
| SAM-REFTrain data=COCO+LVIS, Backbone=ViT-H*, SPC/s=0.511, Fusion Strategy=Late Fusion2024.08 | 1.43 | — | 3.18 | — | — | — | |
| FocSAM-ViT-HBackbone=ViT-H2024.05 | 1.47 | — | — | 0.39 | — | — | |
| FocalClick-segformerB3-S2Train Data=Large Dataset [2,7,13,24,26,39,45,48], Backbone=segformerB32022.04 | 1.48 | — | — | — | — | — | |
| Ours-ViT-B+MST+CLBackbone=ViT-B, MST=true, CL=true, Training Data=COCO [26] and LVIS [27]2024.01 | 1.5 | — | — | — | — | — | |
| FocSAMTrain data=COCO+LVIS, Backbone=VIT-H*, SPC/s=0.467, Fusion Strategy=Late Fusion2024.08 | 1.5 | — | 3.44 | — | — | — | |
| SAM-REFTrain data=COCO+LVIS, Backbone=ViT-B*, SPC/s=0.278, Fusion Strategy=Late Fusion2024.08 | 1.58 | — | 3.73 | — | — | — | |
| GraCo w/ GT+AGGBackbone=ViT-L, Granularity Type=Granularity-Controllable, Granularity control input=GT+AGG, Selection Strategy=Optimal granularity (0 to 1, step 0.1)2024.05 | 1.61 | 1.17 | — | — | — | — | |
| FocalClick-segformer-B3-S2Backbone=segformer-B3-S2, Training Data=COCO [26] and LVIS [27]2024.01 | 1.71 | — | — | — | — | — | |
| FocalClickTrain data=COCO+LVIS, Backbone=SegFB3-S2384, SPC/s=0.232, Fusion Strategy=Early Fusion2024.08 | 1.71 | — | 4.21 | — | — | — | |
| GraCo w/ AGGBackbone=ViT-L, Granularity Type=Granularity-Controllable, Granularity control input=AGG, Selection Strategy=Optimal granularity (0 to 1, step 0.1)2024.05 | 1.73 | 1.23 | — | — | — | — | |
| CFR-ICLBackbone=ViT-H, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 1.74 | — | — | — | — | — | |
| SimpleClickBackbone=ViT-H, Training Data=COCO+LVIS2022.10 | 1.75 | 1.36 | — | — | — | — | |
| SimpleClick-ViT-HBackbone=ViT-H2024.05 | 1.75 | — | — | 6.99 | — | — | |
| SimpleClickTrain data=COCO+LVIS, Backbone=VIT-H, SPC/s=8.24, Fusion Strategy=Early Fusion2024.08 | 1.75 | — | 4.34 | — | — | — | |
| Ours-ViT-B+MSTBackbone=ViT-B, MST=true, Training Data=COCO [26] and LVIS [27]2024.01 | 1.77 | — | — | — | — | — | |
| FocalClick-hrnet32-S2Train Data=Large Dataset [2,7,13,24,26,39,45,48], Backbone=hrnet322022.04 | 1.85 | — | — | — | — | — | |
| SimpleClickBackbone=ViT-L, Training Data=COCO+LVIS2022.10 | 1.89 | 1.34 | — | — | — | — | |
| SimpleClick-ViT-LBackbone=ViT-L2024.05 | 1.89 | — | — | 3.12 | — | — | |
| SAMBackbone=ViT-B, Granularity Type=Multi-granularity, Prediction selection strategy=Best matching result from multiple predictions2024.05 | 1.91 | 1.35 | — | — | — | — | |
| FocalClick-segformerB3-S2Train Data=COCO [26]+LVIS [13], Backbone=segformerB32022.04 | 1.92 | — | — | — | — | — | |
| FocalClickBackbone=SegF-B3, Training Data=COCO+LVIS2022.10 | 1.92 | 1.55 | — | — | — | — | |
| FocalClick-SegFB3-S2Backbone=SegFB3, Model Config=S22024.05 | 1.92 | — | — | 0.1 | — | — | |
| FCFIBackbone=HRNet-18, Train set=COCO+LVIS2023.03 | 1.96 | — | — | — | — | — | |
| SimpleClickBackbone=ViT-B, Training Data=COCO+LVIS2022.10 | 1.97 | 1.36 | — | — | — | — | |
| SimpleClick-ViT-BBackbone=ViT-B, Training Data=COCO [26] and LVIS [27]2024.01 | 1.97 | — | — | — | — | — | |
| SimpleClick-ViT-BBackbone=ViT-B2024.05 | 1.97 | — | — | 1.26 | — | — | |
| SAM-REFTrain data=HQSeg-44K, Backbone=ViT-H*, SPC/s=0.511, Fusion Strategy=Late Fusion2024.08 | 1.98 | — | 4.57 | — | — | — | |
| HQ-SAM-VIT-HBackbone=VIT-H, Training Data=COCO [26] and LVIS [27]2024.01 | 2 | — | — | — | — | — | |
| SAMBackbone=ViT-L, Granularity Type=Multi-granularity, Prediction selection strategy=Best matching result from multiple predictions2024.05 | 2.01 | 1.37 | — | — | — | — | |
| FCFIBackbone=HRNet-18s, Train set=COCO+LVIS2023.03 | 2.05 | — | — | — | — | — | |
| CDNetBackbone=ResNet-34, Training Data=COCO+LVIS2022.10 | 2.06 | 1.47 | — | — | — | — | |
| CDNet-R34Backbone=ResNet-342024.05 | 2.06 | — | — | — | — | — | |
| CDNetTrain data=COCO+LVIS, Backbone=ResNet, Fusion Strategy=Early Fusion2024.08 | 2.06 | — | — | — | — | — | |
| GraCo w/ GT+AGGBackbone=ViT-B, Granularity Type=Granularity-Controllable, Granularity control input=GT+AGG, Selection Strategy=Optimal granularity (0 to 1, step 0.1)2024.05 | 2.07 | 1.33 | — | — | — | — | |
| PseudoClickBackbone=HRNet-32, Training Data=COCO+LVIS2022.10 | 2.08 | 1.4 | — | — | — | — | |
| PseudoClick-HR32Backbone=HR322024.05 | 2.08 | — | — | — | — | — | |
| PseudoClickTrain data=COCO+LVIS, Backbone=HRNet32, Fusion Strategy=Early Fusion2024.08 | 2.08 | — | — | — | — | — | |
| SimpleClickBackbone=ViT-H, Training Data=SBD2022.10 | 2.09 | 1.36 | — | — | — | — | |
| SAMBackbone=ViT-H, Training Dataset=SBD2022.03 | 2.09 | — | — | — | — | — | |
| SAM-ViT-HBackbone=ViT-H, Conventional COCO+LVIS training=false2024.05 | 2.09 | — | — | 0.35 | — | — | |
| SimpleClickBackbone=ViT-H, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 2.09 | 1.36 | — | — | — | — | |
| SAMTrain data=SA-1B, Backbone=ViT-H, SPC/s=0.413, Fusion Strategy=Late Fusion2024.08 | 2.09 | — | 5.14 | — | — | — | |
| RITMBackbone=HRNet-32, Training Dataset=COCO+LVIS, Iterative Mode (IT-M)=true, Number of iterations (Niters)=32021.02 | 2.1 | — | — | — | — | — | |
| RITM-hrnet32Train Data=COCO [26]+LVIS [13], Backbone=hrnet322022.04 | 2.1 | — | — | — | — | — | |
| RITMBackbone=HRNet-32, Training Data=COCO+LVIS2022.10 | 2.1 | 1.43 | — | — | — | — | |
| RITM-hrnet32Backbone=hrnet32, Training Data=COCO [26] and LVIS [27]2024.01 | 2.1 | — | — | — | — | — | |
| RITM-HR32Backbone=HR322024.05 | 2.1 | — | — | — | — | — | |
| RITMTrain data=COCO+LVIS, Backbone=HRNet32, Fusion Strategy=Early Fusion2024.08 | 2.1 | — | 5.41 | — | — | — | |
| CSFPNBackbone=HRNet-18, Training Dataset=COCO+LVIS2022.03 | 2.12 | — | — | — | — | — | |
| HQ-SAMTrain data=HQSeg-44K, Backbone=ViT-H*, SPC/s=0.443, Fusion Strategy=Late Fusion2024.08 | 2.14 | — | 4.94 | — | — | — | |
| MFPBackbone=ViT-B2024.04 | 2.17 | 1.39 | 6.18 | — | — | — | |
| DC-TTABackbone=ViT-B, Input Resolution=1024x1024, Max Clicks=202025.06 | 2.17 | 1.8 | — | — | 0 | 0 | |
| CPlotBackbone=ViT-B, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 2.18 | 1.4 | — | — | — | — | |
| GraCo w/ AGGBackbone=ViT-B, Granularity Type=Granularity-Controllable, Granularity control input=AGG, Selection Strategy=Optimal granularity (0 to 1, step 0.1)2024.05 | 2.21 | 1.37 | — | — | — | — | |
| SAM-VIT-HBackbone=VIT-H, Training Data=COCO [26] and LVIS [27]2024.01 | 2.25 | — | — | — | — | — | |
| RITMBackbone=HRNet-18, Training Dataset=COCO+LVIS, Iterative Mode (IT-M)=true, Number of iterations (Niters)=32021.02 | 2.26 | — | — | — | — | — | |
| RITMBackbone=HRNet-18, Train set=COCO+LVIS2023.03 | 2.26 | — | — | — | — | — | |
| RITMBackbone=HRNet-18, Training Dataset=COCO+LVIS2022.03 | 2.26 | — | — | — | — | — | |
| FocalClick-segformerB0-S2Train Data=COCO [26]+LVIS [13], Backbone=segformerB02022.04 | 2.27 | — | — | — | — | — | |
| FocalClickBackbone=SegF-B0, Training Data=COCO+LVIS2022.10 | 2.27 | 1.59 | — | — | — | — | |
| FocalClick-SegFB0-S2Backbone=SegFB0, Model Config=S22024.05 | 2.27 | — | — | 0.02 | — | — | |
| AdaptSAMBackbone=ViT-B, Input Resolution=1024x1024, Max Clicks=202025.06 | 2.29 | 1.77 | — | — | 0 | 0 | |
| DC-onlyBackbone=ViT-B, Input Resolution=1024x1024, Max Clicks=202025.06 | 2.32 | 1.79 | — | — | 0 | 1 | |
| SimpleClickBackbone=ViT-L, Training Data=SBD2022.10 | 2.33 | 1.4 | — | — | — | — | |
| SimpleClickBackbone=ViT-L, Granularity Type=Single-granularity2024.05 | 2.33 | 1.4 | — | — | — | — | |
| FocalClick-hrnet32-S2Train Data=COCO [26]+LVIS [13], Backbone=hrnet322022.04 | 2.36 | — | — | — | — | — | |
| FocalClickBackbone=HRNet-32, Training Dataset=COCO+LVIS2022.03 | 2.36 | — | — | — | — | — | |
| FocalClick-HR32-S2Backbone=HR32, Model Config=S22024.05 | 2.36 | — | — | 0.14 | — | — | |
| EdgeFlow2021.09 | 2.4 | — | — | — | — | — | |
| EdgeFlow-hrnet18Train Data=COCO [26]+LVIS [13], Backbone=hrnet182022.04 | 2.4 | — | — | — | — | — | |
| EdgeFlowBackbone=HRNet-18, Train set=COCO+LVIS2023.03 | 2.4 | — | — | — | — | — | |
| EdgeFlow-hrnet18Backbone=hrnet18, Training Data=COCO [26] and LVIS [27]2024.01 | 2.4 | — | — | — | — | — | |
| EdgeFlow-HR18Backbone=HR182024.05 | 2.4 | — | — | — | — | — | |
| EdgeFlowTrain data=COCO+LVIS, Backbone=HRNet18, Fusion Strategy=Early Fusion2024.08 | 2.4 | — | — | — | — | — | |
| FocalClick-S2Backbone=HRNet-18s, Train set=COCO+LVIS2023.03 | 2.41 | — | — | — | — | — | |
| BaselineBackbone=ViT-B, Input Resolution=1024x1024, Max Clicks=202025.06 | 2.41 | 1.8 | — | — | 0 | 1 | |
| TENTBackbone=ViT-B, Input Resolution=1024x1024, Max Clicks=202025.06 | 2.41 | 1.77 | — | — | 0 | 1 | |
| SAMBackbone=ViT-L, Granularity Type=Multi-granularity2024.05 | 2.42 | 1.84 | — | — | — | — | |
| f-BRS-B-hrnet32Train Data=COCO [26]+LVIS [13], Backbone=hrnet322022.04 | 2.44 | — | — | — | — | — | |
| f-BRS-B-hrnet32Backbone=hrnet32, Training Data=COCO [26] and LVIS [27]2024.01 | 2.44 | — | — | — | — | — | |
| f-BRS-B-HR32Backbone=HR322024.05 | 2.44 | — | — | — | — | — | |
| SimpleClickBackbone=ViT-B, Training Data=SBD2022.10 | 2.46 | 1.44 | — | — | — | — | |
| SimpleClickBackbone=ViT-B, Granularity Type=Single-granularity2024.05 | 2.46 | 1.44 | — | — | — | — | |
| SimpleClickBackbone=ViT-B2024.04 | 2.46 | 1.44 | 6.7 | — | — | — | |
| SimpleClickBackbone=ViT-B, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 2.46 | 1.44 | — | — | — | — | |
| RITMBackbone=HRNet-18, Training Dataset=COCO+LVIS, Iterative Mode (IT-M)=false2021.02 | 2.48 | — | — | — | — | — | |
| RITM-H18Backbone=HRNet-182021.09 | 2.48 | — | — | — | — | — | |
| iCMFormerBackbone=ViT-B2024.04 | 2.52 | 1.42 | — | — | — | — | |
| InterFormer-TinyModel Size=Tiny2024.05 | 2.53 | — | — | 0.23 | — | — | |
| InterFormer-TinyBackbone=ViT-L, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 2.53 | — | — | — | — | — | |
| InterFormerTrain data=COCO+LVIS, Backbone=VIT-L, SPC/s=0.271, Fusion Strategy=Late Fusion2024.08 | 2.53 | — | — | — | — | — | |
| RITMBackbone=HRNet-18s, Training Dataset=COCO+LVIS, Iterative Mode (IT-M)=true, Number of iterations (Niters)=32021.02 | 2.6 | — | — | — | — | — | |
| RITM-hrnet18sTrain Data=COCO [26]+LVIS [13], Backbone=hrnet18s2022.04 | 2.6 | — | — | — | — | — | |
| RITMBackbone=HRNet-18s, Train set=COCO+LVIS2023.03 | 2.6 | — | — | — | — | — | |
| RITM-hrnet18sBackbone=hrnet18s, Training Data=COCO [26] and LVIS [27]2024.01 | 2.6 | — | — | — | — | — | |
| GPCISBackbone=ResNet-50, Granularity Type=Single-granularity2024.05 | 2.6 | 1.6 | — | — | — | — | |
| GPCISBackbone=ResNet-502024.04 | 2.6 | 1.6 | 6.77 | — | — | — | |
| RITM-HR18sBackbone=HR18s2024.05 | 2.6 | — | — | — | — | — | |
| FocalClick-hrnet18s-S2Train Data=COCO [26]+LVIS [13], Backbone=hrnet18s2022.04 | 2.66 | — | — | — | — | — |