Interactive Segmentation on SBD
3.96NoC @ 90% TargetGraCo w/ AGG
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GraCo w/ AGGBackbone=ViT-L, Granularity Type=Granularity-Controllable, Granularity control input=AGG, Selection Strategy=Optimal granularity (0 to 1, step 0.1)2024.05 | 3.96 | 2.73 | — | |
| GraCo w/ GT+AGGBackbone=ViT-L, Granularity Type=Granularity-Controllable, Granularity control input=GT+AGG, Selection Strategy=Optimal granularity (0 to 1, step 0.1)2024.05 | 3.96 | 2.69 | — | |
| SimpleClickBackbone=ViT-H, Training Data=SBD2022.10 | 4.15 | 2.51 | — | |
| SimpleClickBackbone=ViT-H, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 4.15 | 2.51 | — | |
| CFR-ICLBackbone=ViT-H, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 4.45 | — | — | |
| SimpleClickBackbone=ViT-L, Training Data=SBD2022.10 | 4.46 | 2.69 | — | |
| SimpleClickBackbone=ViT-L, Granularity Type=Single-granularity2024.05 | 4.46 | 2.69 | — | |
| GraCo w/ GT+AGGBackbone=ViT-B, Granularity Type=Granularity-Controllable, Granularity control input=GT+AGG, Selection Strategy=Optimal granularity (0 to 1, step 0.1)2024.05 | 4.65 | 3.22 | — | |
| FocSAM-ViT-HBackbone=ViT-H2024.05 | 4.69 | — | 0.39 | |
| SimpleClickBackbone=ViT-H, Training Data=COCO+LVIS2022.10 | 4.7 | 2.85 | — | |
| SimpleClick-ViT-HBackbone=ViT-H2024.05 | 4.7 | — | 6.99 | |
| CSFPNBackbone=ResNet-101, Training Dataset=SBD2022.03 | 4.83 | 2.98 | — | |
| SimpleClickBackbone=ViT-L, Training Data=COCO+LVIS2022.10 | 4.89 | 2.95 | — | |
| GraCo w/ AGGBackbone=ViT-B, Granularity Type=Granularity-Controllable, Granularity control input=AGG, Selection Strategy=Optimal granularity (0 to 1, step 0.1)2024.05 | 4.89 | 3.44 | — | |
| SimpleClick-ViT-LBackbone=ViT-L2024.05 | 4.89 | — | 3.12 | |
| GraCo w/ GTBackbone=ViT-L, Granularity Type=Granularity-Controllable, Granularity control input=GT, Selection Strategy=Optimal granularity (0 to 1, step 0.1)2024.05 | 4.9 | 3.49 | — | |
| CPlotBackbone=ViT-B, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 4.95 | 3.05 | — | |
| CSFPNBackbone=ResNet-50, Training Dataset=SBD2022.03 | 4.98 | 3.08 | — | |
| Ours-ViT-B+MST+CLBackbone=ViT-B, MST=true, CL=true, Training Data=COCO [26] and LVIS [27]2024.01 | 5.11 | 3.03 | — | |
| Ours-ViT-B+MSTBackbone=ViT-B, MST=true, Training Data=COCO [26] and LVIS [27]2024.01 | 5.2 | 3.03 | — | |
| SimpleClickBackbone=ViT-B, Training Data=SBD2022.10 | 5.24 | 3.28 | — | |
| SimpleClickBackbone=ViT-B, Granularity Type=Single-granularity2024.05 | 5.24 | 3.28 | — | |
| SimpleClickBackbone=ViT-B, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 5.24 | 3.28 | — | |
| CSFPNBackbone=HRNet-18, Training Dataset=SBD2022.03 | 5.25 | 3.33 | — | |
| FocusCutBackbone=ResNet-101, Training Data=SBD2022.10 | 5.31 | 3.4 | — | |
| FocusCutBackbone=ResNet-101, Train set=SBD2023.03 | 5.31 | 3.4 | — | |
| FocusCutBackbone=ResNet-101, Training Dataset=SBD2022.03 | 5.31 | 3.4 | — | |
| FocusCutBackbone=ResNet-101, Granularity Type=Single-granularity2024.05 | 5.31 | 3.4 | — | |
| RITMBackbone=ResNet-101, Training Dataset=SBD, Implementation=re-implemented2022.03 | 5.33 | 3.33 | — | |
| FCFIBackbone=ResNet-101, Train set=SBD2023.03 | 5.35 | 3.26 | — | |
| GraCo w/ GTBackbone=ViT-B, Granularity Type=Granularity-Controllable, Granularity control input=GT, Selection Strategy=Optimal granularity (0 to 1, step 0.1)2024.05 | 5.35 | 3.82 | — | |
| PseudoClickBackbone=HRNet-18, Training Data=SBD2022.10 | 5.4 | 3.38 | — | |
| PseudoClickBackbone=HRNet-18, Training Dataset=SBD2022.03 | 5.4 | — | — | |
| RITMBackbone=HRNet-18, Training Dataset=SBD, Iterative Mode (IT-M)=true, Number of iterations (Niters)=32021.02 | 5.43 | 3.39 | — | |
| RITM-hrnet18Train Data=SBD [15], Backbone=hrnet182022.04 | 5.43 | 3.39 | — | |
| RITMBackbone=HRNet-18, Training Data=SBD2022.10 | 5.43 | 3.39 | — | |
| RITMBackbone=HRNet-18, Training Dataset=SBD2022.03 | 5.43 | 3.39 | — | |
| RITMBackbone=HRNet-18, Granularity Type=Single-granularity2024.05 | 5.43 | 3.39 | — | |
| InterFormer-TinyModel Size=Tiny2024.05 | 5.51 | — | 0.23 | |
| InterFormer-TinyBackbone=ViT-L, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 5.51 | 3.25 | — | |
| PseudoClickBackbone=HRNet-32, Training Data=COCO+LVIS2022.10 | 5.54 | 3.46 | — | |
| PseudoClick-HR32Backbone=HR322024.05 | 5.54 | — | — | |
| FocalClick-segformerB3-S2Train Data=COCO [26]+LVIS [13], Backbone=segformerB32022.04 | 5.59 | 3.53 | — | |
| FocalClickBackbone=SegF-B3, Training Data=COCO+LVIS2022.10 | 5.59 | 3.53 | — | |
| FocalClick-SegFB3-S2Backbone=SegFB3, Model Config=S22024.05 | 5.59 | — | 0.1 | |
| PseudoClickBackbone=HRNet-32, Granularity Type=Single-granularity2024.05 | 5.61 | — | — | |
| SimpleClickBackbone=ViT-B, Training Data=COCO+LVIS2022.10 | 5.62 | 3.43 | — | |
| SimpleClick-ViT-BBackbone=ViT-B, Training Data=COCO [26] and LVIS [27]2024.01 | 5.62 | 3.43 | — | |
| SimpleClick-ViT-BBackbone=ViT-B2024.05 | 5.62 | — | 1.26 | |
| FocusCutBackbone=ResNet-50, Training Data=SBD2022.10 | 5.66 | 3.62 | — | |
| FocusCutBackbone=ResNet-50, Training Dataset=SBD2022.03 | 5.66 | 3.62 | — | |
| RITMBackbone=HRNet-32, Training Dataset=COCO+LVIS, Iterative Mode (IT-M)=true, Number of iterations (Niters)=32021.02 | 5.71 | 3.59 | — | |
| RITM-hrnet32Train Data=COCO [26]+LVIS [13], Backbone=hrnet322022.04 | 5.71 | 3.59 | — | |
| RITMBackbone=HRNet-32, Training Data=COCO+LVIS2022.10 | 5.71 | 3.59 | — | |
| RITM-hrnet32Backbone=hrnet32, Training Data=COCO [26] and LVIS [27]2024.01 | 5.71 | 3.59 | — | |
| GPCISBackbone=ResNet-50, Granularity Type=Single-granularity2024.05 | 5.71 | 3.8 | — | |
| RITM-HR32Backbone=HR322024.05 | 5.71 | — | — | |
| FCFIBackbone=HRNet-18, Train set=COCO+LVIS2023.03 | 5.83 | 3.63 | — | |
| FocalClick-segformerB3-S2Train Data=Large Dataset [2,7,13,24,26,39,45,48], Backbone=segformerB32022.04 | 5.84 | 3.7 | — | |
| CSFPNBackbone=HRNet-18, Training Dataset=COCO+LVIS2022.03 | 5.91 | 3.67 | — | |
| FocalClick-segformer-B3-S2Backbone=segformer-B3-S2, Training Data=COCO [26] and LVIS [27]2024.01 | 5.92 | 3.73 | — | |
| RITMBackbone=HRNet-18, Training Dataset=COCO+LVIS, Iterative Mode (IT-M)=true, Number of iterations (Niters)=32021.02 | 6.06 | 3.8 | — | |
| RITMBackbone=HRNet-18, Train set=COCO+LVIS2023.03 | 6.06 | 3.8 | — | |
| RITMBackbone=HRNet-18, Training Dataset=COCO+LVIS2022.03 | 6.06 | 3.8 | — | |
| FCFIBackbone=HRNet-18s, Train set=COCO+LVIS2023.03 | 6.24 | 3.88 | — | |
| InterFormer-LightModel Size=Light2024.05 | 6.34 | — | 0.13 | |
| RITMBackbone=HRNet-18s, Training Dataset=COCO+LVIS, Iterative Mode (IT-M)=true, Number of iterations (Niters)=32021.02 | 6.48 | 4.04 | — | |
| RITM-hrnet18sTrain Data=COCO [26]+LVIS [13], Backbone=hrnet18s2022.04 | 6.48 | 4.04 | — | |
| RITM-HR18sBackbone=HR18s2024.05 | 6.48 | — | — | |
| FocalClick-segformerB0-S2Train Data=SBD [15], Backbone=segformerB02022.04 | 6.51 | 4.34 | — | |
| FocalClick-hrnet32-S2Train Data=COCO [26]+LVIS [13], Backbone=hrnet322022.04 | 6.51 | 4.24 | — | |
| FocalClickBackbone=SegF-B0, Training Data=SBD2022.10 | 6.51 | 4.34 | — | |
| FocalClickBackbone=HRNet-32, Training Dataset=COCO+LVIS2022.03 | 6.51 | 4.24 | — | |
| FocalClick-HR32-S2Backbone=HR32, Model Config=S22024.05 | 6.51 | — | 0.14 | |
| FocalClickBackbone=SegFormerB0-S2, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 6.51 | 4.34 | — | |
| FocalClick-hrnet18s-S2Train Data=SBD [15], Backbone=hrnet18s2022.04 | 6.52 | 4.3 | — | |
| FocalClickBackbone=HRNet-18s, Training Data=SBD2022.10 | 6.52 | 4.3 | — | |
| FocalClick-S2Backbone=HRNet-18s, Train set=COCO+LVIS2023.03 | 6.59 | 4.37 | — | |
| FocalClick-hrnet32-S2Train Data=Large Dataset [2,7,13,24,26,39,45,48], Backbone=hrnet322022.04 | 6.61 | 4.35 | — | |
| RITMBackbone=HRNet-18, Training Dataset=SBD, Iterative Mode (IT-M)=false2021.02 | 6.66 | 4.12 | — | |
| FocalClick-hrnet18s-S2Train Data=COCO [26]+LVIS [13], Backbone=hrnet18s2022.04 | 6.79 | 4.43 | — | |
| FocalClick-HR18S-S2Backbone=HR18S, Model Config=S22024.05 | 6.79 | — | 0.07 | |
| RITM-hrnet18sBackbone=hrnet18s, Training Data=COCO [26] and LVIS [27]2024.01 | 6.84 | 4.25 | — | |
| RITMBackbone=HRNet-18, Training Dataset=COCO+LVIS, Iterative Mode (IT-M)=false2021.02 | 6.86 | 4.26 | — | |
| FocalClick-segformerB0-S2Train Data=COCO [26]+LVIS [13], Backbone=segformerB02022.04 | 6.86 | 4.56 | — | |
| FocalClickBackbone=SegF-B0, Training Data=COCO+LVIS2022.10 | 6.86 | 4.56 | — | |
| RITMBackbone=HRNet-18s, Train set=COCO+LVIS2023.03 | 6.86 | 4.26 | — | |
| FocalClick-SegFB0-S2Backbone=SegFB0, Model Config=S22024.05 | 6.86 | — | 0.02 | |
| CDNetBackbone=ResNet-34, Training Data=COCO+LVIS2022.10 | 7.04 | 4.3 | — | |
| CDNet-R34Backbone=ResNet-342024.05 | 7.04 | — | — | |
| FocalClick-S1Backbone=HRNet-18s, Train set=COCO+LVIS2023.03 | 7.22 | 4.75 | — | |
| f-BRS-B-hrnet32Train Data=COCO [26]+LVIS [13], Backbone=hrnet322022.04 | 7.26 | 4.37 | — | |
| f-BRS-B-hrnet32Backbone=hrnet32, Training Data=COCO [26] and LVIS [27]2024.01 | 7.26 | 4.37 | — | |
| f-BRS-B-HR32Backbone=HR322024.05 | 7.26 | — | — | |
| FocalClick-hrnet18s-S1Train Data=COCO [26]+LVIS [13], Backbone=hrnet18s2022.04 | 7.29 | 4.74 | — | |
| FocalClick-HR18S-S1Backbone=HR18S, Model Config=S12024.05 | 7.29 | — | 0.03 | |
| FocalClick-segformerB0-S1Train Data=COCO [26]+LVIS [13], Backbone=segformerB02022.04 | 7.6 | 4.98 | — | |
| FocalClick-SegFB0-S1Backbone=SegFB0, Model Config=S12024.05 | 7.6 | — | 0.01 | |
| SAM-ViT-HBackbone=ViT-H, Conventional COCO+LVIS training=false2024.05 | 7.62 | — | 0.35 | |
| CDNetBackbone=ResNet-101, Train set=SBD2023.03 | 7.66 | 4.73 | — |