Interactive Segmentation on DAVIS
3.8NoC@90OIS
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| OISBackbone=ViT-B, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 3.8 | — | — | — | — | |
| FocalClick-segformerB3-S2Train Data=Large Dataset [2,7,13,24,26,39,45,48], Backbone=segformerB32022.04 | 4.52 | 2.92 | — | — | — | |
| Ours-ViT-B+MST+CLBackbone=ViT-B, MST=true, CL=true, Training Data=COCO [26] and LVIS [27]2024.01 | 4.55 | — | — | — | — | |
| FocSAM-ViT-HBackbone=ViT-H2024.05 | 4.77 | — | 0.39 | — | — | |
| CFR-ICLBackbone=ViT-H, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 4.77 | — | — | — | — | |
| SimpleClickBackbone=ViT-H, Training Data=COCO+LVIS2022.10 | 4.78 | 3.41 | — | — | — | |
| SimpleClick-ViT-HBackbone=ViT-H2024.05 | 4.78 | — | 6.99 | — | — | |
| FocalClick-hrnet32-S2Train Data=Large Dataset [2,7,13,24,26,39,45,48], Backbone=hrnet322022.04 | 4.81 | 3.19 | — | — | — | |
| SimpleClickBackbone=ViT-L, Training Data=COCO+LVIS2022.10 | 4.81 | 3.26 | — | — | — | |
| SimpleClick-ViT-LBackbone=ViT-L2024.05 | 4.81 | — | 3.12 | — | — | |
| Ours-ViT-B+MSTBackbone=ViT-B, MST=true, Training Data=COCO [26] and LVIS [27]2024.01 | 4.82 | — | — | — | — | |
| GraCo w/ GT+AGGBackbone=ViT-L, Granularity Type=Granularity-Controllable, Granularity control input=GT+AGG, Selection Strategy=Optimal granularity (0 to 1, step 0.1)2024.05 | 4.83 | 3.87 | — | — | — | |
| FocalClick-segformerB3-S2Train Data=COCO [26]+LVIS [13], Backbone=segformerB32022.04 | 4.9 | 3.61 | — | — | — | |
| FocalClickBackbone=SegF-B3, Training Data=COCO+LVIS2022.10 | 4.9 | 3.61 | — | — | — | |
| FocalClick-SegFB3-S2Backbone=SegFB3, Model Config=S22024.05 | 4.9 | — | 0.1 | — | — | |
| SimpleClickBackbone=ViT-B, Training Data=COCO+LVIS2022.10 | 5.06 | 3.66 | — | — | — | |
| SimpleClick-ViT-BBackbone=ViT-B, Training Data=COCO [26] and LVIS [27]2024.01 | 5.06 | — | — | — | — | |
| SimpleClick-ViT-BBackbone=ViT-B2024.05 | 5.06 | — | 1.26 | — | — | |
| PseudoClickBackbone=HRNet-32, Training Data=COCO+LVIS2022.10 | 5.11 | 3.79 | — | — | — | |
| PseudoClick-HR32Backbone=HR322024.05 | 5.11 | — | — | — | — | |
| FCFIBackbone=HRNet-18s, Train set=COCO+LVIS2023.03 | 5.16 | 3.7 | — | — | — | |
| FCFIBackbone=HRNet-18, Train set=COCO+LVIS2023.03 | 5.16 | 3.97 | — | — | — | |
| GraCo w/ AGGBackbone=ViT-L, Granularity Type=Granularity-Controllable, Granularity control input=AGG, Selection Strategy=Optimal granularity (0 to 1, step 0.1)2024.05 | 5.19 | 4.24 | — | — | — | |
| SAM-ViT-HBackbone=ViT-H, Conventional COCO+LVIS training=false2024.05 | 5.19 | — | 0.35 | — | — | |
| InterFormer-TinyModel Size=Tiny2024.05 | 5.21 | — | 0.23 | — | — | |
| InterFormer-TinyBackbone=ViT-L, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 5.21 | — | — | — | — | |
| CSFPNBackbone=HRNet-18, Training Dataset=COCO+LVIS2022.03 | 5.22 | 4.03 | — | — | — | |
| FocalClick-hrnet18s-S2Train Data=COCO [26]+LVIS [13], Backbone=hrnet18s2022.04 | 5.25 | 3.9 | — | — | — | |
| FocalClick-HR18S-S2Backbone=HR18S, Model Config=S22024.05 | 5.25 | — | 0.07 | — | — | |
| DC-TTABackbone=ViT-B, Input Resolution=1024x1024, Max Clicks=202025.06 | 5.26 | 4.07 | — | 8.99 | 15.07 | |
| CPlotBackbone=ViT-B, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 5.29 | 4 | — | — | — | |
| SAMBackbone=ViT-H, Training Dataset=SBD2022.03 | 5.32 | 4.21 | — | — | — | |
| RITMBackbone=HRNet-32, Training Dataset=COCO+LVIS, Iterative Mode (IT-M)=true, Number of iterations (Niters)=32021.02 | 5.34 | 4.11 | — | — | — | |
| RITM-hrnet32Train Data=COCO [26]+LVIS [13], Backbone=hrnet322022.04 | 5.34 | 4.11 | — | — | — | |
| SimpleClickBackbone=ViT-H, Training Data=SBD2022.10 | 5.34 | 4.2 | — | — | — | |
| RITMBackbone=HRNet-32, Training Data=COCO+LVIS2022.10 | 5.34 | 4.11 | — | — | — | |
| RITM-hrnet32Backbone=hrnet32, Training Data=COCO [26] and LVIS [27]2024.01 | 5.34 | — | — | — | — | |
| RITM-HR32Backbone=HR322024.05 | 5.34 | — | — | — | — | |
| SimpleClickBackbone=ViT-H, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 5.34 | 4.2 | — | — | — | |
| DC-onlyBackbone=ViT-B, Input Resolution=1024x1024, Max Clicks=202025.06 | 5.36 | 4.11 | — | 9.28 | 15.07 | |
| BaselineBackbone=ViT-B, Input Resolution=1024x1024, Max Clicks=202025.06 | 5.38 | 4.21 | — | 9.57 | 15.07 | |
| FocalClick-hrnet32-S2Train Data=COCO [26]+LVIS [13], Backbone=hrnet322022.04 | 5.39 | 4.01 | — | — | — | |
| SimpleClickBackbone=ViT-L, Training Data=SBD2022.10 | 5.39 | 4.12 | — | — | — | |
| FocalClickBackbone=HRNet-32, Training Dataset=COCO+LVIS2022.03 | 5.39 | 4.01 | — | — | — | |
| SimpleClickBackbone=ViT-L, Granularity Type=Single-granularity2024.05 | 5.39 | 4.12 | — | — | — | |
| FocalClick-HR32-S2Backbone=HR32, Model Config=S22024.05 | 5.39 | — | 0.14 | — | — | |
| TENTBackbone=ViT-B, Input Resolution=1024x1024, Max Clicks=202025.06 | 5.39 | 4.22 | — | 9.57 | 15.36 | |
| AdaptSAMBackbone=ViT-B, Input Resolution=1024x1024, Max Clicks=202025.06 | 5.39 | 4.16 | — | 9.28 | 15.07 | |
| SimpleClickBackbone=ViT-B, Training Data=SBD2022.10 | 5.48 | 4.1 | — | — | — | |
| SimpleClickBackbone=ViT-B, Granularity Type=Single-granularity2024.05 | 5.48 | 4.1 | — | — | — | |
| SimpleClickBackbone=ViT-B, Supervision=Supervised: Trained on Ground Truth Labels2024.11 | 5.48 | 4.1 | — | — | — | |
| FocalClick-segformerB0-S2Train Data=COCO [26]+LVIS [13], Backbone=segformerB02022.04 | 5.49 | 4.04 | — | — | — | |
| FocalClickBackbone=SegF-B0, Training Data=COCO+LVIS2022.10 | 5.49 | 4.04 | — | — | — | |
| FocalClick-S2Backbone=HRNet-18s, Train set=COCO+LVIS2023.03 | 5.49 | 4.2 | — | — | — | |
| GraCo w/ GT+AGGBackbone=ViT-B, Granularity Type=Granularity-Controllable, Granularity control input=GT+AGG, Selection Strategy=Optimal granularity (0 to 1, step 0.1)2024.05 | 5.49 | 4.36 | — | — | — | |
| FocalClick-SegFB0-S2Backbone=SegFB0, Model Config=S22024.05 | 5.49 | — | 0.02 | — | — | |
| CDNetBackbone=ResNet-34, Training Data=COCO+LVIS2022.10 | 5.56 | 4.27 | — | — | — | |
| CDNet-R34Backbone=ResNet-342024.05 | 5.56 | — | — | — | — | |
| HQ-SAM-VIT-HBackbone=VIT-H, Training Data=COCO [26] and LVIS [27]2024.01 | 5.58 | — | — | — | — | |
| FocalClick-segformer-B3-S2Backbone=segformer-B3-S2, Training Data=COCO [26] and LVIS [27]2024.01 | 5.59 | — | — | — | — | |
| GraCo w/ AGGBackbone=ViT-B, Granularity Type=Granularity-Controllable, Granularity control input=AGG, Selection Strategy=Optimal granularity (0 to 1, step 0.1)2024.05 | 5.72 | 4.44 | — | — | — | |
| RITMBackbone=HRNet-18, Training Dataset=COCO+LVIS, Iterative Mode (IT-M)=true, Number of iterations (Niters)=32021.02 | 5.74 | 4.36 | — | — | — | |
| RITMBackbone=HRNet-18, Train set=COCO+LVIS2023.03 | 5.74 | 4.36 | — | — | — | |
| RITMBackbone=HRNet-18, Training Dataset=COCO+LVIS2022.03 | 5.74 | 4.36 | — | — | — | |
| EdgeFlow2021.09 | 5.77 | 4.54 | — | — | — | |
| EdgeFlow-hrnet18Train Data=COCO [26]+LVIS [13], Backbone=hrnet182022.04 | 5.77 | 4.54 | — | — | — | |
| EdgeFlowBackbone=HRNet-18, Train set=COCO+LVIS2023.03 | 5.77 | 4.54 | — | — | — | |
| EdgeFlow-hrnet18Backbone=hrnet18, Training Data=COCO [26] and LVIS [27]2024.01 | 5.77 | — | — | — | — | |
| EdgeFlow-HR18Backbone=HR182024.05 | 5.77 | — | — | — | — | |
| CSFPNBackbone=ResNet-101, Training Dataset=SBD2022.03 | 5.8 | 4.51 | — | — | — | |
| CSFPNBackbone=ResNet-50, Training Dataset=SBD2022.03 | 5.83 | 4.52 | — | — | — | |
| GPCISBackbone=ResNet-50, Granularity Type=Single-granularity2024.05 | 5.89 | 4.37 | — | — | — | |
| RITMBackbone=HRNet-18s, Training Dataset=COCO+LVIS, Iterative Mode (IT-M)=true, Number of iterations (Niters)=32021.02 | 5.98 | 4.7 | — | — | — | |
| RITM-hrnet18sTrain Data=COCO [26]+LVIS [13], Backbone=hrnet18s2022.04 | 5.98 | 4.7 | — | — | — | |
| RITM-hrnet18sBackbone=hrnet18s, Training Data=COCO [26] and LVIS [27]2024.01 | 5.98 | — | — | — | — | |
| RITM-HR18sBackbone=HR18s2024.05 | 5.98 | — | — | — | — | |
| RITMBackbone=HRNet-18, Training Dataset=COCO+LVIS, Iterative Mode (IT-M)=false2021.02 | 6 | 4.79 | — | — | — | |
| RITM-H18Backbone=HRNet-182021.09 | 6 | 4.79 | — | — | — | |
| RITMBackbone=HRNet-18s, Train set=COCO+LVIS2023.03 | 6 | 4.79 | — | — | — | |
| CSFPNBackbone=HRNet-18, Training Dataset=SBD2022.03 | 6.01 | 4.68 | — | — | — | |
| PseudoClickBackbone=HRNet-32, Granularity Type=Single-granularity2024.05 | 6.16 | 4.74 | — | — | — | |
| InterFormer-LightModel Size=Light2024.05 | 6.19 | — | 0.13 | — | — | |
| SAM-VIT-HBackbone=VIT-H, Training Data=COCO [26] and LVIS [27]2024.01 | 6.21 | — | — | — | — | |
| FocusCutBackbone=ResNet-101, Training Data=SBD2022.10 | 6.22 | 4.85 | — | — | — | |
| FocusCutBackbone=ResNet-101, Train set=SBD2023.03 | 6.22 | 4.85 | — | — | — | |
| FocusCutBackbone=ResNet-101, Training Dataset=SBD2022.03 | 6.22 | 4.85 | — | — | — | |
| FocusCutBackbone=ResNet-101, Granularity Type=Single-granularity2024.05 | 6.22 | 4.85 | — | — | — | |
| FocusCutBackbone=ResNet-50, Training Data=SBD2022.10 | 6.38 | 5 | — | — | — | |
| FocusCutBackbone=ResNet-50, Training Dataset=SBD2022.03 | 6.38 | 5 | — | — | — | |
| SAMBackbone=ViT-B, Granularity Type=Multi-granularity, Prediction selection strategy=Best matching result from multiple predictions2024.05 | 6.44 | 4.81 | — | — | — | |
| FocalClick-segformer-B0-S2Backbone=segformer-B0-S2, Training Data=COCO [26] and LVIS [27]2024.01 | 6.47 | — | — | — | — | |
| FocalClick-hrnet18s-S2Train Data=SBD [15], Backbone=hrnet18s2022.04 | 6.48 | 4.92 | — | — | — | |
| FocalClickBackbone=HRNet-18s, Training Data=SBD2022.10 | 6.48 | 4.92 | — | — | — | |
| FCFIBackbone=ResNet-101, Train set=SBD2023.03 | 6.48 | 4.75 | — | — | — | |
| SAMBackbone=ViT-L, Granularity Type=Multi-granularity2024.05 | 6.48 | 4.94 | — | — | — | |
| SAMBackbone=ViT-L, Granularity Type=Multi-granularity, Prediction selection strategy=Best matching result from multiple predictions2024.05 | 6.48 | 5.04 | — | — | — | |
| f-BRS-B-hrnet32Train Data=COCO [26]+LVIS [13], Backbone=hrnet322022.04 | 6.5 | 5.17 | — | — | — | |
| f-BRS-B-hrnet32Backbone=hrnet32, Training Data=COCO [26] and LVIS [27]2024.01 | 6.5 | — | — | — | — | |
| f-BRS-B-HR32Backbone=HR322024.05 | 6.5 | — | — | — | — | |
| FocalClick-hrnet18s-S1Train Data=COCO [26]+LVIS [13], Backbone=hrnet18s2022.04 | 6.56 | 4.77 | — | — | — |