Instance Segmentation on COCO (val)
55APmkEVA
Evaluation Results
| Method | Links | ||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| EVAdetector=CMask R-CNN [12], #param.=1074M, pre-training data (encoder)=merged-30M, pre-training data (detector)=O365, tta=false2022.11 | 55 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EVAEvaluation Scale=single-scale, Input Resolution=1280x12802022.11 | 55 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EVA-02-LType=Specialist Models2023.12 | 55 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask DINO#param.=223M, pre-training data (encoder)=IN-21K (14M), pre-training data (detector)=O365, tta=null2022.11 | 54.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask DINO / 2021 competition 1st (Prev. Best)2022.11 | 54.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLEE-ProType=Foundation Models2023.12 | 54.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SwinV2-Gdetector=HTC++ [17], #param.=>= 3000M, pre-training data (encoder)=IN-21K-ext-70M, pre-training data (detector)=O365, tta=true2022.11 | 53.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Uni-Perceiver-v2 (L)Type=Generalist Models2023.12 | 53.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenSeeD (L)Type=Open-vocabulary, Backbone=Large, Evaluation Protocol=Without fine-tuning2023.03 | 53.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTDet, ViT-Hframework=Cascade, pre-train=1K, MAE, backbone_type=plain, testing_scale=multi-scale2022.03 | 53.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTDet-Hdetector=CMask R-CNN [12], #param.=692M, pre-training data (encoder)=IN-1K (1M), tta=null2022.11 | 53.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTDet-H2022.11 | 53.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLEE-PlusType=Foundation Models2023.12 | 53 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Soft-Teacherdetector=HTC++ [17], #param.=284M, pre-training data (encoder)=IN-21K (14M), pre-training data (detector)=COCO(unlabeled)+O365, tta=true2022.11 | 52.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTDet, ViT-Lframework=Cascade, pre-train=1K, MAE, backbone_type=plain, testing_scale=multi-scale2022.03 | 52.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SwinV2-Lframework=HTC++, pre-train=21K, sup, backbone_type=hierarchical, testing_scale=multi-scale2022.03 | 52.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTDet, ViT-Hframework=Cascade, pre-train=1K, MAE, backbone_type=plain, testing_scale=single-scale2022.03 | 52 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CBNetV2framework=HTC, pre-train=21K, sup, backbone_type=hierarchical, testing_scale=multi-scale2022.03 | 51.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UNINEXT (H)Type=Generalist Models2023.12 | 51.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SwinV2-Lframework=HTC++, pre-train=21K, sup, backbone_type=hierarchical, testing_scale=single-scale2022.03 | 51.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTDet, ViT-Lframework=Cascade, pre-train=1K, MAE, backbone_type=plain, testing_scale=single-scale2022.03 | 51.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CBNetV2framework=HTC, pre-train=21K, sup, backbone_type=hierarchical, testing_scale=single-scale2022.03 | 51 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTDet-HSupervision protocol=fully-supervised2023.04 | 51 | — | — | 32 | 54.3 | 68.9 | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTDet-HType=Specialist Models2023.12 | 50.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaskDINO (L)Type=Closed-set, Backbone=Large2023.03 | 50.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Uni-Perceiver-v2 (B)Type=Generalist Models2023.12 | 50.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Uni-Perceiver-v2Method Category=Vision Generalist2024.03 | 50.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MViTv2-LFramework=Cascade, Multi-scale testing=true, Params=270M2021.12 | 50.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MViTv2-Lframework=Cascade, pre-train=21K, sup, backbone_type=hierarchical, testing_scale=multi-scale2022.03 | 50.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HorNet-L_GFBackbone=HorNet-L_GF, Framework=HTC++, Testing scale=single-scale2022.07 | 50.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-LFramework=HTC++, Multi-scale testing=true, Params=284M2021.12 | 50.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-Lframework=HTC++, pre-train=21K, sup, backbone_type=hierarchical, testing_scale=multi-scale2022.03 | 50.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-Adapter-LBackbone=ViT-Adapter-L, Framework=HTC++, Testing scale=single-scale2022.07 | 50.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MViTv2-Hframework=Cascade, pre-train=21K, sup, backbone_type=hierarchical, testing_scale=multi-scale2022.03 | 50.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UM-MAEFramework=HTC++, Backbone=Swin-L, Pre-train=IN1K, unsup, Epoch=362022.05 | 49.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTDet-LType=Specialist Models2023.12 | 49.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UNINEXT (L)Type=Generalist Models2023.12 | 49.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-LFramework=HTC++, Multi-scale testing=false, FLOPs=1470G, Params=284M2021.12 | 49.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BaselineFramework=HTC++, Backbone=Swin-L, Pre-train=IN22K, sup, Epoch=722022.05 | 49.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-Lframework=HTC++, pre-train=21K, sup, backbone_type=hierarchical, testing_scale=single-scale2022.03 | 49.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-LBackbone=Swin-L, Framework=HTC++, Testing scale=single-scale2022.07 | 49.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTDet, ViT-Bframework=Cascade, pre-train=1K, MAE, backbone_type=plain, testing_scale=multi-scale2022.03 | 49.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTDet-Lpretrain=MAE, FLOPs=1.9T, params=331M, time=396ms2023.06 | 49.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniRepLKNet-XLParams (M)=443, FLOPs (G)=1952, Input Resolution=1280x800, Pre-trained=ImageNet-22K [12]2023.11 | 49 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cascade Eff-B7 NAS-FPN w/ self-training Copy-PasteInput image size=1280, FLOPs=1440B, # Params=185M, augmentation=Copy-Paste, training=self-training2020.12 | 48.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Copy-Paste2022.11 | 48.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormer (L)Type=Closed-set, Backbone=Large2023.03 | 48.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MViTv2-Hframework=Cascade, pre-train=21K, sup, backbone_type=hierarchical, testing_scale=single-scale2022.03 | 48.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternImage-XLParams (M)=387, FLOPs (G)=1782, Input Resolution=1280x800, Pre-trained=ImageNet-22K [12]2023.11 | 48.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MViTv2-LFramework=Cascade, Multi-scale testing=false, FLOPs=1519G, Params=270M2021.12 | 48.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MViTv2-Lframework=Cascade, pre-train=21K, sup, backbone_type=hierarchical, testing_scale=single-scale2022.03 | 48.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HorNet-LGFBackbone=HorNet-LGF, Framework=Cascade Mask R-CNN 3x, Pre-training=ImageNet-22K2022.07 | 48.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2Former (L)Type=Closed-set, Backbone=Large2023.03 | 48.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Hiera-Lpretrain=MAE, FLOPs=1.2T, params=236M, time=340ms2023.06 | 48.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternImage-LParams (M)=277, FLOPs (G)=1399, Input Resolution=1280x800, Pre-trained=ImageNet-22K [12]2023.11 | 48.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLEE-LiteType=Foundation Models2023.12 | 48.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniRepLKNet-LParams (M)=276, FLOPs (G)=1385, Input Resolution=1280x800, Pre-trained=ImageNet-22K [12]2023.11 | 48.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cas MaskBackbone=RepLKNet-XL, Param (M)=392, FLOPs (G)=1958, Pre-training=ImageNet-22K, Input Resolution=1280x8002022.03 | 48 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTDet, ViT-Bframework=Cascade, pre-train=1K, MAE, backbone_type=plain, testing_scale=single-scale2022.03 | 48 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HorNet-L7x7Backbone=HorNet-L7x7, Framework=Cascade Mask R-CNN 3x, Pre-training=ImageNet-22K2022.07 | 48 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ConvNeXt-XLBackbone=ConvNeXt-XL, Framework=Cascade Mask R-CNN 3x, Pre-training=ImageNet-22K2022.07 | 47.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ConvNeXt-XLParams (M)=407, FLOPs (G)=1898, Input Resolution=1280x800, Pre-trained=ImageNet-22K [12]2023.11 | 47.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ConvNeXt-LBackbone=ConvNeXt-L, Framework=Cascade Mask R-CNN 3x, Pre-training=ImageNet-22K2022.07 | 47.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenSeeD (T)Type=Open-vocabulary, Backbone=Tiny, Evaluation Protocol=Without fine-tuning2023.03 | 47.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ConvNeXt-LParams (M)=255, FLOPs (G)=1354, Input Resolution=1280x800, Pre-trained=ImageNet-22K [12]2023.11 | 47.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask R-CNN w/ TurboBackbone=CX-v2-FPN, Turbo=true, GPU=RTX 2080Ti, Batch size=22026.06 | 47.6 | 69.8 | 52.1 | 28.3 | 51 | 65.7 | — | — | — | — | — | — | — | 5.2 | — | — | — | — | |
| MViTv2-Lpretrain=Sup, 21K, FLOPs=1.3T, params=239M, time=447ms2023.06 | 47.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MViTv2-Bpretrain=Sup, 21K, FLOPs=0.6T, params=73M, time=208ms2023.06 | 47.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SegRefinerBase Model=Mask2Former2023.12 | 47.4 | — | — | 28.5 | 55.3 | 69.8 | 38.8 | — | — | 28.4 | 51 | 48.5 | — | — | — | — | — | — | |
| UniRepLKNet-BParams (M)=155, FLOPs (G)=978, Input Resolution=1280x800, Pre-trained=ImageNet-22K [12]2023.11 | 47.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Hiera-B+pretrain=MAE, FLOPs=0.6T, params=92M, time=192ms2023.06 | 47.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Ours-D3S2Backbone=ViT-B, Mode=Hybrid2026.05 | 47.3 | 70.8 | 51.4 | 27.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cascade Eff-B7 NAS-FPN w/ Copy-PasteInput image size=1280, FLOPs=1440B, # Params=185M, augmentation=Copy-Paste2020.12 | 47.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Copy-PasteFramework=Cascade, NAS-FPN, Multi-scale testing=false, FLOPs=1440G, Params=185M2021.12 | 47.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MViTv2-Lpretrain=Sup, FLOPs=1.3T, params=239M, time=447ms2023.06 | 47.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniRepLKNet-SParams (M)=113, FLOPs (G)=835, Input Resolution=1280x800, Pre-trained=ImageNet-22K [12]2023.11 | 47.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HorNet-BGFBackbone=HorNet-BGF, Framework=Cascade Mask R-CNN 3x, Pre-training=ImageNet-1K2022.07 | 46.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ConvNeXt-BParams (M)=146, FLOPs (G)=964, Input Resolution=1280x800, Pre-trained=ImageNet-22K [12]2023.11 | 46.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cascade Eff-B7 NAS-FPNInput image size=1280, FLOPs=1440B, # Params=185M2020.12 | 46.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2FormerBase Model=Mask2Former2023.12 | 46.8 | — | — | 27.9 | 54.9 | 69.1 | 37 | — | — | 27.8 | 50.1 | 44.6 | — | — | — | — | — | — | |
| Mask R-CNN w/ TurboBackbone=Vit-B, Turbo=true, GPU=RTX 2080Ti, Batch size=22026.06 | 46.8 | 69.4 | 51.1 | 27.7 | 50.2 | 64.9 | — | — | — | — | — | — | — | 3.3 | — | — | — | — | |
| Cas MaskBackbone=Swin-L, Param (M)=254, FLOPs (G)=1382, Pre-training=ImageNet-22K, Input Resolution=1280x8002022.03 | 46.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-LBackbone=Swin-L, Framework=Cascade Mask R-CNN 3x, Pre-training=ImageNet-22K2022.07 | 46.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| X-Decoder (L)Type=Open-vocabulary, Backbone=Large, Evaluation Protocol=Fine-tuned2023.03 | 46.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MViTv2-Bpretrain=Sup, FLOPs=0.6T, params=73M, time=208ms2023.06 | 46.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| X-Decoder (L)Type=Generalist Models2023.12 | 46.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-LParams (M)=253, FLOPs (G)=1382, Input Resolution=1280x800, Pre-trained=ImageNet-22K [12]2023.11 | 46.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cas MaskBackbone=RepLKNet-31L, Param (M)=229, FLOPs (G)=1321, Pre-training=ImageNet-22K, Input Resolution=1280x8002022.03 | 46.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SAMSupervision protocol=zero-shot, Prompting source=ViTDet boxes2023.04 | 46.5 | — | — | 30.8 | 51 | 61.7 | — | — | — | — | — | — | — | — | — | — | — | — | |
| RepLKNet-31LParams (M)=229, FLOPs (G)=1321, Input Resolution=1280x800, Pre-trained=ImageNet-22K [12]2023.11 | 46.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask R-CNNBackbone=CX-v2-FPN, Turbo=false, GPU=RTX 2080Ti, Batch size=22026.06 | 46.4 | 69.9 | 50.7 | 27.3 | 49.8 | 64.8 | — | — | — | — | — | — | — | 5.4 | — | — | — | — | |
| HorNet-SGFBackbone=HorNet-SGF, Framework=Cascade Mask R-CNN 3x, Pre-training=ImageNet-1K2022.07 | 46.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2Former (B)Type=Closed-set, Backbone=Base2023.03 | 46.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Hiera-Bpretrain=MAE, FLOPs=0.6T, params=73M, time=173ms2023.06 | 46.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-Lpretrain=Sup, 21K, FLOPs=1.1T, params=218M, time=243ms2023.06 | 46.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpineNet-190resolution=1536x1536, FLOPs=2076.8B, Params=176.2M, training_protocol=protocol C2019.12 | 46.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpineNet-190Input image size=1536, FLOPs=2076B, # Params=176M2020.12 | 46.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HorNet-B7x7Backbone=HorNet-B7x7, Framework=Cascade Mask R-CNN 3x, Pre-training=ImageNet-1K2022.07 | 46.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Semantic-SAMBackbone=Swin-T, Mode=FT2026.05 | 46.1 | — | — | 27.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cas MaskBackbone=RepLKNet-31B, Param (M)=137, FLOPs (G)=965, Pre-training=ImageNet-22K, Input Resolution=1280x8002022.03 | 46 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |