Instance Segmentation on COCO 2017
53APmRevCol-H
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| RevCol-HDetector=HTC++, Number of parameters=2.41B, Image Size=[400-1400, 1600], Fine-tuning Protocol=Directly fine-tuning on MSCOCO without intermediate fine-tuning on Objects3652023.05 | 53 | — | — | — | — | — | — | |
| ONE-PEACEDetector=Cascade, Number of parameters=1.59B, Image Size=1280 x 1280, Fine-tuning Protocol=Directly fine-tuning on MSCOCO without intermediate fine-tuning on Objects3652023.05 | 52.9 | — | — | — | — | — | — | |
| ViTDetDetector=Cascade, Number of parameters=692M, Image Size=1280 x 1280, Fine-tuning Protocol=Directly fine-tuning on MSCOCO without intermediate fine-tuning on Objects3652023.05 | 52 | — | — | — | — | — | — | |
| ViT-AdapterDetector=HTC++, Number of parameters=401M, Image Size=[400-1400, 1600], Fine-tuning Protocol=Directly fine-tuning on MSCOCO without intermediate fine-tuning on Objects3652023.05 | 51.1 | — | — | — | — | — | — | |
| VanillaResolution=1024, Backbone=ViT-B, Detection Model=ViTDeT [32], Pre-training=ImageNet-1K via MAE [36]2024.05 | 46 | 69 | 50 | 27 | 49 | 64 | — | |
| TransNeXt-BaseBackbone=TransNeXt-Base, Token Mixing Type=Conv + Attn, Param (M)=109, MACs (G)=728, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 45.9 | 70.5 | 49.7 | — | — | — | — | |
| MaxViT-BResolution=896x896, Pre-trained=ImageNet-1K, FLOPs=856G, Pars.=157M2022.04 | 45.7 | 70.3 | 50 | — | — | — | — | |
| ConvNeXt-BResolution=1280x800, Pre-trained=ImageNet-1K, FLOPs=964G2022.04 | 45.6 | 68.9 | 49.5 | — | — | — | — | |
| TransNeXt-SmallBackbone=TransNeXt-Small, Token Mixing Type=Conv + Attn, Param (M)=69, MACs (G)=516, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 45.5 | 69.8 | 49.1 | — | — | — | — | |
| MaxViT-SResolution=896x896, Pre-trained=ImageNet-1K, FLOPs=595G, Pars.=107M2022.04 | 45.4 | 69.8 | 49.5 | — | — | — | — | |
| As-ViT-LResolution=1024x1024, Pre-trained=ImageNet-1K, FLOPs=1094G, Pars.=139M2022.04 | 45.2 | 69.7 | 49.8 | — | — | — | — | |
| Swin-S-DCT-KParam (M)=107, DCT-based initialization=true2024.05 | 45.1 | 68.3 | 49.1 | — | — | — | — | |
| ConvNeXt-SResolution=1280x800, Pre-trained=ImageNet-1K, FLOPs=827G2022.04 | 45 | 68.4 | 49.1 | — | — | — | — | |
| Swin-SResolution=1280x800, Pre-trained=ImageNet-1K, FLOPs=838G, Pars.=107M2022.04 | 45 | 68.2 | 48.8 | — | — | — | — | |
| Swin-BResolution=1280x800, Pre-trained=ImageNet-1K, FLOPs=982G, Pars.=145M2022.04 | 45 | 68.1 | 48.9 | — | — | — | — | |
| Swin-S-DCT-0.75Param (M)=102, Compression Ratio=0.752024.05 | 45 | 68 | 48.8 | — | — | — | — | |
| AdaRouteBackbone=ConvNeXt-L, # P (M)=9.22026.02 | 44.8 | 69.2 | 48.4 | — | — | — | — | |
| Swin-SParam (M)=1072024.05 | 44.7 | 67.9 | 48.5 | — | — | — | — | |
| MaxViT-TResolution=896x896, Pre-trained=ImageNet-1K, FLOPs=475G, Pars.=69M2022.04 | 44.6 | 69.1 | 48.4 | — | — | — | — | |
| TransNeXt-TinyBackbone=TransNeXt-Tiny, Token Mixing Type=Conv + Attn, Param (M)=48, MACs (G)=356, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 44.6 | 68.6 | 48.1 | — | — | — | — | |
| MonaBackbone=ConvNeXt-L, # P (M)=9.12026.02 | 44.4 | 68.4 | 48.1 | — | — | — | — | |
| UVIT-BResolution=896x896, Pre-trained=ImageNet-1K, FLOPs=975G, Pars.=74M2022.04 | 44.3 | 68.7 | 48.3 | — | — | — | — | |
| UVIT-SResolution=896x896, Pre-trained=ImageNet-1K, FLOPs=744G, Pars.=54M2022.04 | 44.1 | 68.2 | 48 | — | — | — | — | |
| AdaRouteBackbone=Swin-L, # P (M)=7.32026.02 | 44 | 68.4 | 47.6 | — | — | — | — | |
| CSWin-BBackbone=CSWin-B, Token Mixing Type=Attn, Param (M)=97, MACs (G)=526, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 43.9 | 67.8 | 47.3 | — | — | — | — | |
| VMamba-B†Backbone=VMamba-B†, Token Mixing Type=Conv + SSM, Param (M)=108, MACs (G)=485, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 43.9 | 67.7 | 47.6 | — | — | — | — | |
| MonaBackbone=Swin-L, # P (M)=7.52026.02 | 43.9 | 68.2 | 47.6 | — | — | — | — | |
| Swin-T-DCT-KParam (M)=86, DCT-based initialization=true2024.05 | 43.9 | 66.6 | 47.6 | — | — | — | — | |
| Full-tuningBackbone=Swin-L, # P (M)=1952026.02 | 43.8 | 68.1 | 47.3 | — | — | — | — | |
| CoLoRABackbone=ConvNeXt-L, # P (M)=9.42026.02 | 43.8 | 67.8 | 47.5 | — | — | — | — | |
| ConvNeXt-TResolution=1280x800, Pre-trained=ImageNet-1K, FLOPs=741G2022.04 | 43.7 | 66.5 | 47.3 | — | — | — | — | |
| Swin-TResolution=1280x800, Pre-trained=ImageNet-1K, FLOPs=745G, Pars.=86M2022.04 | 43.7 | 66.6 | 47.3 | — | — | — | — | |
| BiFormer-BFramework=Mask R-CNN, Schedule=1x2023.03 | 43.7 | 67.6 | 47.1 | — | — | — | — | |
| VMamba-S†Backbone=VMamba-S†, Token Mixing Type=Conv + SSM, Param (M)=64, MACs (G)=357, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 43.7 | 67.3 | 47 | — | — | — | — | |
| BiFormer-BFramework=Mask R-CNN, Training Schedule=1x2024.10 | 43.7 | 67.6 | 47.1 | — | — | — | — | |
| vHeat-SFramework=Mask R-CNN, Schedule=3x MS, Input size=1280x800, FPS (images/s)=25.9, FLOPS=348G2024.05 | 43.7 | — | — | — | — | — | — | |
| Swin-TParam (M)=862024.05 | 43.7 | 66.6 | 47.3 | — | — | — | — | |
| Swin-T-DCT-0.75Param (M)=83, Compression Ratio=0.752024.05 | 43.7 | 66.8 | 47.6 | — | — | — | — | |
| UVIT-TResolution=896x896, Pre-trained=ImageNet-1K, FLOPs=613G, Pars.=47M2022.04 | 43.6 | 67.7 | 47.2 | — | — | — | — | |
| SG-Former-MBackbone=SG-Former-M, Token Mixing Type=Conv + Attn, Param (M)=51, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 43.6 | 66.9 | 47 | — | — | — | — | |
| FocalNet-BBackbone=FocalNet-B, Token Mixing Type=Conv, Param (M)=111, MACs (G)=507, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 43.5 | 67.9 | 46.7 | — | — | — | — | |
| AdaRouteBackbone=ConvNeXt-B, # P (M)=6.52026.02 | 43.5 | 67.5 | 46.9 | — | — | — | — | |
| DeiT-BBackbone=DeiT-B, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=141M, OPs=1041G2026.03 | 43.49 | 66.25 | 47.05 | 24.69 | 46.03 | 61.05 | — | |
| BinaryAttention-BBackbone=BinaryAttention-B, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=141M, OPs=941G2026.03 | 43.49 | 66.28 | 47.15 | 24.28 | 46.17 | 62.23 | — | |
| DeiT-BBackbone=DeiT-B, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=141M, OPs=1041G2026.03 | 43.49 | 66.25 | 47.05 | 24.69 | 46.03 | 61.05 | — | |
| BinaryAttention-BBackbone=BinaryAttention-B, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=141M, OPs=941G2026.03 | 43.49 | 66.28 | 47.15 | 24.28 | 46.17 | 62.23 | — | |
| SageAttention-BBackbone=SageAttention-B, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=141M, OPs=999G2026.03 | 43.48 | 66.27 | 47.06 | 24.55 | 45.98 | 61.06 | — | |
| SageAttention-BBackbone=SageAttention-B, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=141M, OPs=999G2026.03 | 43.48 | 66.27 | 47.06 | 24.55 | 45.98 | 61.06 | — | |
| InternImage-SFramework=Mask R-CNN, Training Schedule=1x2024.10 | 43.3 | 67.1 | 46.7 | — | — | — | — | |
| LoRABackbone=ConvNeXt-L, # P (M)=8.82026.02 | 43.3 | 67.2 | 46.8 | — | — | — | — | |
| BinaryAttention-BBackbone=BinaryAttention-B, Detector=Mask R-CNN, Input Resolution=1024x1024, #Param.=111M, OPs=685G2026.03 | 43.24 | 66.75 | 46.44 | 24.6 | 46.1 | 61.03 | — | |
| BiFormer-SFramework=Mask R-CNN, Schedule=1x2023.03 | 43.2 | 66.8 | 46.5 | — | — | — | — | |
| CSWin-SFramework=Mask R-CNN, Schedule=1x2023.03 | 43.2 | 67.1 | 46.2 | — | — | — | — | |
| CSWin-SBackbone=CSWin-S, Token Mixing Type=Attn, Param (M)=54, MACs (G)=342, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 43.2 | 67.1 | 46.2 | — | — | — | — | |
| LocalVMamba-SBackbone=LocalVMamba-S, Token Mixing Type=Conv + SSM, Param (M)=69, MACs (G)=414, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 43.2 | 66.7 | 46.5 | — | — | — | — | |
| BiFormer-SFramework=Mask R-CNN, Training Schedule=1x2024.10 | 43.2 | 66.8 | 46.5 | — | — | — | — | |
| CSWin-SFramework=Mask R-CNN, Training Schedule=1x2024.10 | 43.2 | 67.1 | 46.2 | — | — | — | — | |
| DeBiFormer-BFramework=Mask R-CNN, Training Schedule=1x2024.10 | 43.2 | 67.2 | 46.4 | — | — | — | — | |
| Swin-SFramework=Mask R-CNN, Schedule=3x MS, Input size=1280x800, FPS (images/s)=19.7, FLOPS=359G2024.05 | 43.2 | — | — | — | — | — | — | |
| CoLoRABackbone=ConvNeXt-B, # P (M)=6.42026.02 | 43.2 | 67.2 | 46.7 | — | — | — | — | |
| MonaBackbone=ConvNeXt-B, # P (M)=6.52026.02 | 43.2 | 67 | 46.7 | — | — | — | — | |
| Full-tuningBackbone=ConvNeXt-L, # P (M)=196.22026.02 | 43.2 | 66.8 | 46.7 | — | — | — | — | |
| FocalNet-SBackbone=FocalNet-S, Token Mixing Type=Conv, Param (M)=72, MACs (G)=365, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 43.1 | 67.4 | 46.2 | — | — | — | — | |
| VMamba-BBackbone=VMamba-B, Token Mixing Type=Conv + SSM, Param (M)=96, MACs (G)=540, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 43.1 | 67 | 46.4 | — | — | — | — | |
| RepAdapterBackbone=Swin-L, # P (M)=8.72026.02 | 43.1 | 67.3 | 46.7 | — | — | — | — | |
| Wave-ViT-B*Framework=Mask R-CNN, Schedule=1x2023.03 | 43 | 66.4 | 46 | — | — | — | — | |
| VMamba-SBackbone=VMamba-S, Token Mixing Type=Conv + SSM, Param (M)=64, MACs (G)=400, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 43 | 66.6 | 46.4 | — | — | — | — | |
| MambaOut-BaseBackbone=MambaOut-Base, Token Mixing Type=Conv, Param (M)=100, MACs (G)=495, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 43 | 66.4 | 46.3 | — | — | — | — | |
| vHeat-BFramework=Mask R-CNN, Schedule=1x, Input size=1280x800, FPS (images/s)=20.2, FLOPS=432G2024.05 | 43 | — | — | — | — | — | — | |
| Full-tuningBackbone=ConvNeXt-B, # P (M)=87.62026.02 | 43 | 66.9 | 46.3 | — | — | — | — | |
| SageAttention-BBackbone=SageAttention-B, Detector=Mask R-CNN, Input Resolution=1024x1024, #Param.=111M, OPs=742G2026.03 | 42.99 | 66.5 | 46.29 | 23.82 | 45.65 | 61.83 | — | |
| DeiT-BBackbone=DeiT-B, Detector=Mask R-CNN, Input Resolution=1024x1024, #Param.=111M, OPs=785G2026.03 | 42.98 | 66.48 | 46.29 | 23.82 | 45.64 | 61.85 | — | |
| ConvNeXt-SFramework=Mask R-CNN, Schedule=3x MS, Input size=1280x800, FPS (images/s)=20.2, FLOPS=349G2024.05 | 42.9 | — | — | — | — | — | — | |
| Full-tuningBackbone=Swin-B, # P (M)=86.82026.02 | 42.8 | 66.6 | 46 | — | — | — | — | |
| AdaptFormerBackbone=Swin-L, # P (M)=8.12026.02 | 42.8 | 67 | 46 | — | — | — | — | |
| BinaryAttention-SBackbone=BinaryAttention-S, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=75M, OPs=647G2026.03 | 42.72 | 65.42 | 46.09 | 23.8 | 45.23 | 61.37 | — | |
| BinaryAttention-SBackbone=BinaryAttention-S, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=75M, OPs=647G2026.03 | 42.72 | 65.42 | 46.09 | 23.8 | 45.23 | 61.37 | — | |
| CrossFormer-BFramework=Mask R-CNN, Schedule=1x2023.03 | 42.7 | 66.6 | 46.2 | — | — | — | — | |
| VMamba-T†Backbone=VMamba-T†, Token Mixing Type=Conv + SSM, Param (M)=50, MACs (G)=270, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 42.7 | 66.3 | 46 | — | — | — | — | |
| MambaOut-SmallBackbone=MambaOut-Small, Token Mixing Type=Conv, Param (M)=65, MACs (G)=354, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 42.7 | 66.1 | 46.2 | — | — | — | — | |
| ConvNeXt-BBackbone=ConvNeXt-B, Token Mixing Type=Conv, Param (M)=108, MACs (G)=486, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 42.7 | 66.3 | 46 | — | — | — | — | |
| CrossFormer-BFramework=Mask R-CNN, Training Schedule=1x2024.10 | 42.7 | 66.6 | 46.2 | — | — | — | — | |
| Agent-Swin-SFramework=Mask R-CNN, Training Schedule=1x2024.10 | 42.7 | 66.6 | 45.8 | — | — | — | — | |
| ConvNeXt-BFramework=Mask R-CNN, Schedule=1x, Input size=1280x800, FPS (images/s)=14.1, FLOPS=486G2024.05 | 42.7 | — | — | — | — | — | — | |
| AdaRouteBackbone=Swin-B, # P (M)=5.22026.02 | 42.7 | 66.7 | 46.2 | — | — | — | — | |
| SG-Former-SBackbone=SG-Former-S, Token Mixing Type=Conv + Attn, Param (M)=41, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 42.6 | 65.9 | 46 | — | — | — | — | |
| DeiT-SBackbone=DeiT-S, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=75M, OPs=696G2026.03 | 42.52 | 65.12 | 45.9 | 23.32 | 45.4 | 60.89 | — | |
| DeiT-SBackbone=DeiT-S, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=75M, OPs=696G2026.03 | 42.52 | 65.12 | 45.9 | 23.32 | 45.4 | 60.89 | — | |
| SageAttention-SBackbone=SageAttention-S, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=75M, OPs=675G2026.03 | 42.51 | 65.13 | 45.93 | 23.41 | 45.38 | 60.88 | — | |
| SageAttention-SBackbone=SageAttention-S, Detector Head=Cascade Mask R-CNN, Input Resolution=1024x1024, #Param.=75M, OPs=675G2026.03 | 42.51 | 65.13 | 45.93 | 23.41 | 45.38 | 60.88 | — | |
| DAT-SFramework=Mask R-CNN, Schedule=1x2023.03 | 42.5 | 66.7 | 45.4 | — | — | — | — | |
| PVTv2-B3Backbone=PVTv2-B3, Token Mixing Type=Conv + Attn, Param (M)=65, MACs (G)=397, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 42.5 | 65.7 | 45.7 | — | — | — | — | |
| PVTv2-B5Backbone=PVTv2-B5, Token Mixing Type=Conv + Attn, Param (M)=102, MACs (G)=557, Framework=Mask R-CNN, Training Schedule=1x2024.05 | 42.5 | 65.7 | 46 | — | — | — | — | |
| InternImage-TFramework=Mask R-CNN, Training Schedule=1x2024.10 | 42.5 | 66.1 | 45.8 | — | — | — | — | |
| DeBiFormer-SFramework=Mask R-CNN, Training Schedule=1x2024.10 | 42.5 | 66.2 | 45.7 | — | — | — | — | |
| DAT-SFramework=Mask R-CNN, Training Schedule=1x2024.10 | 42.5 | 66.7 | 45.4 | — | — | — | — | |
| AdaptFormerBackbone=ConvNeXt-L, # P (M)=9.62026.02 | 42.5 | 66.4 | 45.8 | — | — | — | — | |
| WaveViT-S*Framework=Mask R-CNN, Schedule=1x2023.03 | 42.4 | 65.5 | 45.8 | — | — | — | — | |
| vHeat-TFramework=Mask R-CNN, Schedule=3x MS, Input size=1280x800, FPS (images/s)=32.7, FLOPS=272G2024.05 | 42.4 | — | — | — | — | — | — | |
| MonaBackbone=Swin-B, # P (M)=5.22026.02 | 42.4 | 66.2 | 45.6 | — | — | — | — |