Instance Segmentation on COCO
54.8APmaskBEIT-3
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BEIT-32022.08 | 54.8 | — | — | |
| Mask DINO2022.08 | 54.7 | — | — | |
| Uni-Perceiver-v2 LARGEparameters=446M, task-specific fine-tuning=false2022.11 | 53.6 | — | — | |
| HIPIEBackbone=ViT-H2023.07 | 51.9 | — | — | |
| HIPIEBackbone=ViT-H2023.07 | 51.9 | — | — | |
| Uni-Perceiver-v2 BASEparameters=308M, task-specific fine-tuning=false2022.11 | 50.6 | — | — | |
| MViTv2-L (SoftNMS, MS)Backbone=MViTv2-L, Pre-training=IN-21K, Training schedule=50 epochs, large-scale jittering, Inference strategy=SoftNMS and multiscale testing, Params=270 M2021.12 | 50.5 | — | — | |
| MViTv2-H (IN-21K, LSJ)Backbone=MViTv2-H, Pre-training=IN-21K, Training schedule=50 epochs, large-scale jittering, FLOPs=3084 G, Params=718 M2021.12 | 48.5 | — | — | |
| MViTv2-L (IN-21K, LSJ)Backbone=MViTv2-L, Pre-training=IN-21K, Training schedule=50 epochs, large-scale jittering, FLOPs=1519 G, Params=270 M2021.12 | 48.3 | — | — | |
| CAE*Backbone=ViT-L, #Epochs=1600, Pre-training Supervision=Self-supervised, Framework=Mask R-CNN, Schedule=1x2022.02 | 47.6 | 72.2 | 51.9 | |
| CAEBackbone=ViT-L, #Epochs=1600, Pre-training Supervision=Self-supervised, Framework=Mask R-CNN, Schedule=1x2022.02 | 47.6 | 72 | 51.9 | |
| MViTv2-B (IN-21K)Backbone=MViTv2-B, Pre-training=IN-21K, FLOPs=814 G, Params=103 M2021.12 | 47.4 | — | — | |
| TEC_MAEBackbone=ViT-B, Framework=Cascade MaskRCNN, Source Implementation=Li et al., 2022b2022.10 | 47.2 | — | — | |
| MViTv2-LBackbone=MViTv2-L, FLOPs=1519 G, Params=270 M2021.12 | 47.1 | — | — | |
| MAEBackbone=ViT-L, #Epochs=1600, Pre-training Supervision=Self-supervised, Framework=Mask R-CNN, Schedule=1x2022.02 | 47.1 | 71.5 | 51 | |
| VIC-MAEpre-train data=IN1K+K710+MiT, Backbone=ViT-B Mask R-CNN2023.03 | 46.9 | — | — | |
| MViTv2-BBackbone=MViTv2-B, FLOPs=814 G, Params=103 M2021.12 | 46.8 | — | — | |
| SEEMBackbone=DaViT-B2023.07 | 46.8 | — | — | |
| SEEMBackbone=DaViT-B2023.07 | 46.8 | — | — | |
| MAEBackbone=ViT-B, Framework=Cascade MaskRCNN, Source Implementation=Li et al., 2022b2022.10 | 46.7 | — | — | |
| C-MAEpre-train data=IN1K, Backbone=ViT-B Mask R-CNN2023.03 | 46.5 | — | — | |
| VIC-MAEpre-train data=IN1K+K400, Backbone=ViT-B Mask R-CNN2023.03 | 46.5 | — | — | |
| SiameseIM2022.06 | 46.2 | — | — | |
| MViTv2-SBackbone=MViTv2-S, FLOPs=748 G, Params=87 M2021.12 | 46 | — | — | |
| ODISEBackbone=ViT-H+SD2023.07 | 46 | — | — | |
| ODISEBackbone=ViT-H+SD2023.07 | 46 | — | — | |
| RDNet-BBackbone=RDNet-B, Param=144M, FLOPs=971G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 46 | 69.1 | 50 | |
| MAE2022.06 | 45.9 | — | — | |
| HIPIEBackbone=RN502023.07 | 45.9 | — | — | |
| HIPIEBackbone=RN502023.07 | 45.9 | — | — | |
| X-DecoderBackbone=DaViT-B2023.07 | 45.8 | — | — | |
| X-DecoderBackbone=DaViT-B2023.07 | 45.8 | — | — | |
| ConvNeXt-BBackbone=ConvNeXt-B, Param=146M, FLOPs=964G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 45.6 | 68.9 | 49.5 | |
| TEC_iBOTBackbone=ViT-B, Framework=Cascade MaskRCNN, Source Implementation=Zhou et al., 2022a2022.10 | 45.4 | — | — | |
| RDNet-SBackbone=RDNet-S, Param=108M, FLOPs=832G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 45.4 | 68.5 | 49.3 | |
| C-JEPAPretrain Epochs=600, Backbone=ViT-B/162024.10 | 45.3 | — | — | |
| NAT-BBackbone=NAT-B, Param=147M, FLOPs=931G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 45.2 | 68.6 | 49 | |
| Full-precisionNetwork=Swin-S + Cascade Mask R-CNN, #Bits=32/32, Size=427.82024.11 | 45 | — | — | |
| Full-precisionNetwork=Swin-B + Cascade Mask R-CNN, #Bits=32/32, Size=579.92024.11 | 45 | — | — | |
| RepQ-ViT + QwTNetwork=Swin-B + Cascade Mask R-CNN, #Bits=6/6, Size=126.12024.11 | 45 | — | — | |
| MViTv2-TBackbone=MViTv2-T, FLOPs=701 G, Params=76 M2021.12 | 45 | — | — | |
| Swin-BBackbone=Swin-B, FLOPs=982 G, Params=145 M2021.12 | 45 | — | — | |
| Swin-SBackbone=Swin-S, Param=107M, FLOPs=838G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 45 | 68.2 | 48.8 | |
| ConvNeXt-SBackbone=ConvNeXt-S, Param=108M, FLOPs=827G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 45 | 68.4 | 49.1 | |
| Swin-BBackbone=Swin-B, Param=145M, FLOPs=982G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 45 | 68.1 | 48.9 | |
| NAT-SBackbone=NAT-S, Param=108M, FLOPs=809G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 44.9 | 68.1 | 48.6 | |
| MAEpre-train data=IN1K, Backbone=ViT-B Mask R-CNN2023.03 | 44.9 | — | — | |
| MAEPretrain Epochs=1600, Backbone=ViT-B/162024.10 | 44.9 | — | — | |
| RepQ-ViT + QwTNetwork=Swin-S + Cascade Mask R-CNN, #Bits=6/6, Size=91.32024.11 | 44.8 | — | — | |
| RepQ-ViTNetwork=Swin-B + Cascade Mask R-CNN, #Bits=6/6, Size=112.12024.11 | 44.8 | — | — | |
| Swin-SBackbone=Swin-S, FLOPs=838 G, Params=107 M2021.12 | 44.7 | — | — | |
| RepQ-ViTNetwork=Swin-S + Cascade Mask R-CNN, #Bits=6/6, Size=83.42024.11 | 44.6 | — | — | |
| HPMPretrain Epoch=800, Pre-trained Data=IN1K, Resolution=224x2242024.07 | 44.6 | — | — | |
| RDNet-TBackbone=RDNet-T, Param=81M, FLOPs=757G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 44.6 | 67.9 | 48.3 | |
| NAT-TBackbone=NAT-T, Param=85M, FLOPs=737G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 44.5 | 67.6 | 47.9 | |
| I-JEPAPretrain Epochs=600, Backbone=ViT-B/162024.10 | 44.5 | — | — | |
| ColorMAE-GPretrain Epoch=1600, Pre-trained Data=IN1K, Resolution=224x2242024.07 | 44.4 | 67.8 | 48 | |
| BEiTPretrain Epochs=800, Backbone=ViT-B/162024.10 | 44.4 | — | — | |
| mc-BEiTIntermediate Fine-tuning=True (ImageNet-1K), Task head=Cascaded Mask R-CNN, Training schedule=1x2022.03 | 44.3 | — | — | |
| iBOTArch.=ViT-B/162021.11 | 44.2 | — | — | |
| iBOTIntermediate Fine-tuning=False, Task head=Cascaded Mask R-CNN, Training schedule=1x2022.03 | 44.2 | — | — | |
| iBOTBackbone=ViT-B, Framework=Cascade MaskRCNN, Source Implementation=Zhou et al., 2022a2022.10 | 44.2 | — | — | |
| CAEBackbone=ViT-B, #Epochs=1600, Pre-training Supervision=Self-supervised, Framework=Mask R-CNN, Schedule=1x2022.02 | 44.2 | 68.3 | 47.9 | |
| iBOTPretrain Epochs=1600, Backbone=ViT-B/162024.10 | 44.2 | — | — | |
| CAE*Backbone=ViT-B, #Epochs=1600, Pre-training Supervision=Self-supervised, Framework=Mask R-CNN, Schedule=1x2022.02 | 44 | 67.9 | 47.6 | |
| CAE-GReaTDetector=Mask R-CNN, Schedule=1x2024.07 | 44 | 67.9 | 47.3 | |
| CAE*Backbone=ViT-B, #Epochs=800, Pre-training Supervision=Self-supervised, Framework=Mask R-CNN, Schedule=1x2022.02 | 43.9 | 67.8 | 47.4 | |
| CSwin-BBackbone=CSwin-B, Param=97M, FLOPs=526G, Framework=Mask-RCNN, Schedule=1x, Image size=(1280, 800)2024.03 | 43.9 | 67.8 | 47.3 | |
| BEITIntermediate Fine-tuning=True (ImageNet-1K), Task head=Cascaded Mask R-CNN, Training schedule=1x2022.03 | 43.8 | — | — | |
| MAEPretrain Epoch=1600, Pre-trained Data=IN1K, Resolution=224x2242024.07 | 43.8 | 66.6 | 47.5 | |
| RepQ-ViT + QwTNetwork=Swin-B + Cascade Mask R-CNN, #Bits=4/4, Size=90.12024.11 | 43.7 | — | — | |
| Swin-TBackbone=Swin-T, FLOPs=745 G, Params=86 M2021.12 | 43.7 | — | — | |
| ColorMAE-GPretrain Epoch=800, Pre-trained Data=IN1K, Resolution=224x2242024.07 | 43.7 | 67.1 | 47.1 | |
| Swin-TBackbone=Swin-T, Param=86M, FLOPs=745G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 43.7 | 66.6 | 47.3 | |
| ConvNeXt-TBackbone=ConvNeXt-T, Param=86M, FLOPs=741G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 43.7 | 66.5 | 47.3 | |
| BEiTArch.=ViT-B/162021.11 | 43.5 | — | — | |
| MixedAEPretrain Epoch=800, Pre-trained Data=IN1K, Resolution=224x2242024.07 | 43.5 | 66.2 | 47.4 | |
| RepQ-ViT + QwTNetwork=Swin-S + Cascade Mask R-CNN, #Bits=4/4, Size=64.82024.11 | 43.4 | — | — | |
| DINOArch.=ViT-B/162021.11 | 43.4 | — | — | |
| DINOIntermediate Fine-tuning=False, Task head=Cascaded Mask R-CNN, Training schedule=1x2022.03 | 43.4 | — | — | |
| MAEPretrain Epoch=800, Pre-trained Data=IN1K, Resolution=224x2242024.07 | 43.4 | 66.6 | 46.9 | |
| RDNet-BBackbone=RDNet-B, Param=107M, FLOPs=493G, Framework=Mask-RCNN, Schedule=1x, Image size=(1280, 800)2024.03 | 43.4 | 67.5 | 46.6 | |
| DINOPretrain Epochs=1600, Backbone=ViT-B/162024.10 | 43.4 | — | — | |
| Full-precisionNetwork=Swin-S + Mask R-CNN, #Bits=32/32, Size=276.52024.11 | 43.3 | — | — | |
| FocalNet-B (SRF)Backbone=FocalNet-B (SRF), Param=109M, FLOPs=496G, Framework=Mask-RCNN, Schedule=1x, Image size=(1280, 800)2024.03 | 43.3 | 67.5 | 46.5 | |
| SEERData=IG-1B, Params=693 M2021.03 | 43.2 | — | — | |
| SupervisedArch.=ViT-B/162021.11 | 43.2 | — | — | |
| CSwin-SBackbone=CSwin-S, Param=54M, FLOPs=342G, Framework=Mask-RCNN, Schedule=1x, Image size=(1280, 800)2024.03 | 43.2 | 67.1 | 46.2 | |
| RepQ-ViT + QwTNetwork=Swin-S + Mask R-CNN, #Bits=6/6, Size=61.22024.11 | 43.1 | — | — | |
| RepQ-ViTNetwork=Swin-S + Cascade Mask R-CNN, #Bits=4/4, Size=56.92024.11 | 43.1 | — | — | |
| RepQ-ViTNetwork=Swin-B + Cascade Mask R-CNN, #Bits=4/4, Size=76.12024.11 | 43.1 | — | — | |
| mc-BEiTIntermediate Fine-tuning=False, Task head=Cascaded Mask R-CNN, Training schedule=1x2022.03 | 43.1 | — | — | |
| DetCon_BData=IN-1M, Params=250 M2021.03 | 43 | — | — | |
| RDNet-SBackbone=RDNet-S, Param=70M, FLOPs=354G, Framework=Mask-RCNN, Schedule=1x, Image size=(1280, 800)2024.03 | 43 | 66.9 | 46.3 | |
| RepQ-ViTNetwork=Swin-S + Mask R-CNN, #Bits=6/6, Size=53.32024.11 | 42.9 | — | — | |
| SupervisedIntermediate Fine-tuning=False, Task head=Cascaded Mask R-CNN, Training schedule=1x2022.03 | 42.9 | — | — | |
| BEITIntermediate Fine-tuning=False, Task head=Cascaded Mask R-CNN, Training schedule=1x2022.03 | 42.8 | — | — | |
| MoCo v3Intermediate Fine-tuning=False, Task head=Cascaded Mask R-CNN, Training schedule=1x2022.03 | 42.7 | — | — | |
| MoCo-v32022.06 | 42.7 | — | — | |
| iBOTBackbone=ViT-B, #Epochs=1600+, Pre-training Supervision=Self-supervised, Framework=Mask R-CNN, Schedule=1x2022.02 | 42.7 | 66.5 | 46 |