Object Detection on COCO (AP^b, AP^b_50, AP^b_75)
73.2AP50 (Box)TransNeXt-Base
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| TransNeXt-BaseEncoder size (M)=89.7, #Params. (M)=109.2, Framework=Mask R-CNN, Schedule=1x2023.11 | 73.2 | 51.7 | 56.9 | |
| TransNext-SmallEncoder size (M)=49.7, #Params. (M)=69.3, Framework=Mask R-CNN, Schedule=1x2023.11 | 72.6 | 51.1 | 56.2 | |
| SAGA-SPara (M)=44, FLOPs (G)=266, Detector=Mask R-CNN, Schedule=3x2025.09 | 71.9 | 51 | 55.9 | |
| TransNeXt-TinyEncoder size (M)=28.2, #Params. (M)=47.9, Framework=Mask R-CNN, Schedule=1x2023.11 | 71.5 | 49.9 | 54.9 | |
| RDNet-BBackbone=RDNet-B, Param=144M, FLOPs=971G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 71.5 | 52.9 | 57.2 | |
| VMamba-BBackbone=VMamba-B, Schedule=1x, Architecture=Mask R-CNN, Params=108M, FLOPs=485G2024.01 | 71.4 | 49.2 | 54 | |
| SAGA-SPara (M)=44, FLOPs (G)=266, Detector=Mask R-CNN, Schedule=1x2025.09 | 71.4 | 50.1 | 55.3 | |
| ConvNeXt-BBackbone=ConvNeXt-B, Param=146M, FLOPs=964G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 71.3 | 52.7 | 57.2 | |
| NaLaFormer-SPara (M)=44, FLOPs (G)=272, Detector=Mask R-CNN, Schedule=1x2025.09 | 71.2 | 49.5 | 54.3 | |
| NAT-BBackbone=NAT-B, Param=147M, FLOPs=931G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 71.1 | 52.5 | 57.1 | |
| MLLA-TPara (M)=44, FLOPs (G)=255, Detector=Mask R-CNN, Schedule=3x2025.09 | 71 | 48.8 | 53.6 | |
| InternImage-BEncoder size (M)=97, #Params. (M)=115, Framework=Mask R-CNN, Schedule=1x2023.11 | 70.9 | 48.8 | 54 | |
| FocalNet-B (LRF)Encoder size (M)=88.7, #Params. (M)=111.4, Framework=Mask R-CNN, Schedule=1x2023.11 | 70.9 | 49 | 53.9 | |
| VMamba-SBackbone=VMamba-S, Schedule=3x MS, Architecture=Mask R-CNN, Params=70M, FLOPs=349G2024.01 | 70.9 | 49.9 | 54.7 | |
| ConvNeXt-SBackbone=ConvNeXt-S, Param=108M, FLOPs=827G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 70.8 | 51.9 | 56.5 | |
| RDNet-SBackbone=RDNet-S, Param=108M, FLOPs=832G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 70.8 | 52.3 | 56.6 | |
| ColorMAE-GPretrain Epoch=1600, Pre-trained Data=IN1K, Resolution=224x2242024.07 | 70.7 | 50.1 | 54.7 | |
| FocalNet-B (SRF)Backbone=FocalNet-B (SRF), Param=109M, FLOPs=496G, Framework=Mask-RCNN, Schedule=1x, Image size=(1280, 800)2024.03 | 70.7 | 48.8 | 53.5 | |
| Swin-SBackbone=Swin-S, Param=107M, FLOPs=838G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 70.7 | 51.9 | 56.3 | |
| CSWin-TPara (M)=42, FLOPs (G)=279, Detector=Mask R-CNN, Schedule=3x2025.09 | 70.7 | 49 | 53.7 | |
| FocalNet-S (LRF)Encoder size (M)=50.3, #Params. (M)=72.3, Framework=Mask R-CNN, Schedule=1x2023.11 | 70.5 | 48.3 | 53.1 | |
| BiFormer-BEncoder size (M)=56.8, #Params. (M)=76.3, Framework=Mask R-CNN, Schedule=1x2023.11 | 70.5 | 48.6 | 53.8 | |
| RDNet-TBackbone=RDNet-T, Param=81M, FLOPs=757G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 70.5 | 51.6 | 56 | |
| Swin-BBackbone=Swin-B, Param=145M, FLOPs=982G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 70.5 | 51.9 | 56.4 | |
| DefMamba-BBackbone=DefMamba-B, #FLOPS=349G, Framework=Mask R-CNN, Schedule=1x2025.04 | 70.5 | 48.7 | 53.8 | |
| RILSBackbone=ViT-B/16, Pre-training Dataset=L-20M, Pre-training Epochs=25, Fine-tuning Epochs=252023.01 | 70.5 | 48.5 | 53.2 | |
| MPVIT-SPara (M)=43, FLOPs (G)=268, Detector=Mask R-CNN, Schedule=3x2025.09 | 70.5 | 48.4 | 52.6 | |
| NaLaFormer-SPara (M)=44, FLOPs (G)=272, Detector=Mask R-CNN, Schedule=3x2025.09 | 70.5 | 49.7 | 54.7 | |
| CSWin-BEncoder size (M)=78, #Params. (M)=97, Framework=Mask R-CNN, Schedule=1x2023.11 | 70.4 | 48.7 | 53.9 | |
| CSwin-BBackbone=CSwin-B, Param=97M, FLOPs=526G, Framework=Mask-RCNN, Schedule=1x, Image size=(1280, 800)2024.03 | 70.4 | 48.7 | 53.9 | |
| RDNet-BBackbone=RDNet-B, Param=107M, FLOPs=493G, Framework=Mask-RCNN, Schedule=1x, Image size=(1280, 800)2024.03 | 70.4 | 48.8 | 53.5 | |
| NAT-SBackbone=NAT-S, Param=108M, FLOPs=809G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 70.4 | 52 | 56.3 | |
| VMamba-TBackbone=VMamba-T, Schedule=3x MS, Architecture=Mask R-CNN, Params=50M, FLOPs=271G2024.01 | 70.4 | 48.8 | 53.5 | |
| Vanilla-VMamba-SBackbone=Vanilla-VMamba-S, Schedule=3x MS, Architecture=Mask R-CNN, Params=64M, FLOPs=400G2024.01 | 70.4 | 49.7 | 54.2 | |
| InternImage-TPara (M)=49, FLOPs (G)=270, Detector=Mask R-CNN, Schedule=3x2025.09 | 70.4 | 49.1 | 54.1 | |
| GrootV-SBackbone=GrootV-S, #FLOPS=341G, Framework=Mask R-CNN, Schedule=1x2025.04 | 70.3 | 48.6 | 53.5 | |
| SAGA-TPara (M)=34, FLOPs (G)=221, Detector=Mask R-CNN, Schedule=3x2025.09 | 70.3 | 48.7 | 53.5 | |
| SMT-BEncoder size (M)=32, #Params. (M)=51.7, Framework=Mask R-CNN, Schedule=1x2023.11 | 70.2 | 49 | 53.7 | |
| CSWin-SEncoder size (M)=35, #Params. (M)=54, Framework=Mask R-CNN, Schedule=1x2023.11 | 70.1 | 47.9 | 52.6 | |
| CSwin-SBackbone=CSwin-S, Param=54M, FLOPs=342G, Framework=Mask-RCNN, Schedule=1x, Image size=(1280, 800)2024.03 | 70.1 | 47.9 | 52.6 | |
| FocalNet-TBackbone=FocalNet-T, Param=86M, FLOPs=746G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 70.1 | 51.5 | 55.8 | |
| ColorMAE-GPretrain Epoch=800, Pre-trained Data=IN1K, Resolution=224x2242024.07 | 70 | 49.5 | 54.2 | |
| NAT-TBackbone=NAT-T, Param=85M, FLOPs=737G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 70 | 51.4 | 55.9 | |
| VMamba-SBackbone=VMamba-S, Schedule=1x, Architecture=Mask R-CNN, Params=70M, FLOPs=349G2024.01 | 70 | 48.7 | 53.4 | |
| Vanilla-VMamba-BBackbone=Vanilla-VMamba-B, Schedule=1x, Architecture=Mask R-CNN, Params=96M, FLOPs=540G2024.01 | 70 | 48.6 | 53.1 | |
| Vanilla-VMamba-TBackbone=Vanilla-VMamba-T, Schedule=3x MS, Architecture=Mask R-CNN, Params=42M, FLOPs=286G2024.01 | 70 | 48.5 | 52.7 | |
| ConvNeXt-SBackbone=ConvNeXt-S, Schedule=3x MS, Architecture=Mask R-CNN, Params=70M, FLOPs=348G2024.01 | 70 | 47.9 | 52.7 | |
| FocalNet-S (SRF)Backbone=FocalNet-S (SRF), Param=71M, FLOPs=356G, Framework=Mask-RCNN, Schedule=1x, Image size=(1280, 800)2024.03 | 69.9 | 48 | 52.7 | |
| RDNet-SBackbone=RDNet-S, Param=70M, FLOPs=354G, Framework=Mask-RCNN, Schedule=1x, Image size=(1280, 800)2024.03 | 69.9 | 48.2 | 53 | |
| ConvNeXt-BBackbone=ConvNeXt-B, Param=108M, FLOPs=486G, Framework=Mask-RCNN, Schedule=1x, Image size=(1280, 800)2024.03 | 69.9 | 47.5 | 51.9 | |
| LocalVMamba-SBackbone=LocalVMamba-S, #FLOPS=414G, Framework=Mask R-CNN, Schedule=1x2025.04 | 69.9 | 48.4 | 52.7 | |
| InternImage-SEncoder size (M)=50, #Params. (M)=69, Framework=Mask R-CNN, Schedule=1x2023.11 | 69.8 | 47.8 | 52.8 | |
| BiFormer-SEncoder size (M)=25.5, #Params. (M)=45.2, Framework=Mask R-CNN, Schedule=1x2023.11 | 69.8 | 47.8 | 52.3 | |
| PVTv2-B2Backbone=PVTv2-B2, Param=83M, FLOPs=788G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 69.8 | 51.1 | 55.3 | |
| Swin-SBackbone=Swin-S, Schedule=3x MS, Architecture=Mask R-CNN, Params=69M, FLOPs=354G2024.01 | 69.8 | 48.2 | 52.8 | |
| MAEPretrain Epoch=800, Pre-trained Data=IN1K, Resolution=224x2242024.07 | 69.7 | 49.2 | 53.9 | |
| Vanilla-VMamba-SBackbone=Vanilla-VMamba-S, Schedule=1x, Architecture=Mask R-CNN, Params=64M, FLOPs=400G2024.01 | 69.7 | 48.2 | 52.5 | |
| VMamba-SBackbone=VMamba-S, #FLOPS=400G, Framework=Mask R-CNN, Schedule=1x2025.04 | 69.7 | 48.2 | 52.5 | |
| MAE+CLIPBackbone=ViT-B/16, Pre-training Dataset=L-20M, Pre-training Epochs=25, Fine-tuning Epochs=252023.01 | 69.6 | 48.1 | 52.5 | |
| SMT-SEncoder size (M)=20.5, #Params. (M)=40, Framework=Mask R-CNN, Schedule=1x2023.11 | 69.5 | 47.8 | 52.1 | |
| MLLA-TPara (M)=44, FLOPs (G)=255, Detector=Mask R-CNN, Schedule=1x2025.09 | 69.5 | 46.8 | 51.5 | |
| MAEPretrain Epoch=1600, Pre-trained Data=IN1K, Resolution=224x2242024.07 | 69.4 | 50.6 | 55 | |
| ConvNeXt-BBackbone=ConvNeXt-B, Schedule=1x, Architecture=Mask R-CNN, Params=108M, FLOPs=486G2024.01 | 69.4 | 47 | 51.7 | |
| VMamba-TBackbone=VMamba-T, Schedule=1x, Architecture=Mask R-CNN, Params=50M, FLOPs=271G2024.01 | 69.3 | 47.3 | 52 | |
| VMamba-TPara (M)=50, FLOPs (G)=271, Detector=Mask R-CNN, Schedule=1x2025.09 | 69.3 | 47.3 | 52 | |
| Swin-BEncoder size (M)=87.8, #Params. (M)=107.1, Framework=Mask R-CNN, Schedule=1x2023.11 | 69.2 | 46.9 | 51.6 | |
| Swin-BBackbone=Swin-B, Param=107M, FLOPs=496G, Framework=Mask-RCNN, Schedule=1x, Image size=(1280, 800)2024.03 | 69.2 | 46.9 | 51.6 | |
| Swin-TBackbone=Swin-T, Param=86M, FLOPs=745G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 69.2 | 50.4 | 54.7 | |
| MixedAEPretrain Epoch=800, Pre-trained Data=IN1K, Resolution=224x2242024.07 | 69.1 | 50.3 | 54.8 | |
| ConvNeXt-TBackbone=ConvNeXt-T, Param=86M, FLOPs=741G, Schedule=3x, Image size=1280x800, Framework=Cascade Mask-RCNN2024.03 | 69.1 | 50.4 | 54.8 | |
| CLIPBackbone=ViT-B/16, Pre-training Dataset=L-20M, Pre-training Epochs=25, Fine-tuning Epochs=252023.01 | 69.1 | 47.7 | 52.3 | |
| RAVLT-TPara (M)=33, FLOPs (G)=219, Detector=Mask R-CNN, Schedule=1x2025.09 | 69.1 | 47.2 | 51.7 | |
| SAGA-TPara (M)=34, FLOPs (G)=221, Detector=Mask R-CNN, Schedule=1x2025.09 | 69.1 | 47.2 | 52 | |
| InternImage-TEncoder size (M)=30, #Params. (M)=49, Framework=Mask R-CNN, Schedule=1x2023.11 | 69 | 47.2 | 52.1 | |
| ConvNeXt-SBackbone=ConvNeXt-S, Param=70M, FLOPs=348G, Framework=Mask-RCNN, Schedule=1x, Image size=(1280, 800)2024.03 | 69 | 46.8 | 51.5 | |
| InternImage-TPara (M)=49, FLOPs (G)=270, Detector=Mask R-CNN, Schedule=1x2025.09 | 69 | 47.2 | 52.1 | |
| Swin-SEncoder size (M)=49.6, #Params. (M)=69.1, Framework=Mask R-CNN, Schedule=1x2023.11 | 68.7 | 46.5 | 51.3 | |
| PVTv2-B4Encoder size (M)=62.6, #Params. (M)=82.2, Framework=Mask R-CNN, Schedule=1x2023.11 | 68.7 | 47.5 | 52 | |
| Swin-SBackbone=Swin-S, Param=69M, FLOPs=354G, Framework=Mask-RCNN, Schedule=1x, Image size=(1280, 800)2024.03 | 68.7 | 46.5 | 51.3 | |
| CSWin-TEncoder size (M)=23, #Params. (M)=42, Framework=Mask R-CNN, Schedule=1x2023.11 | 68.6 | 46.7 | 51.3 | |
| PVTv2-B5Encoder size (M)=82, #Params. (M)=101.6, Framework=Mask R-CNN, Schedule=1x2023.11 | 68.6 | 47.4 | 51.9 | |
| DINOPretrain Epoch=1600, Pre-trained Data=IN1K, Resolution=224x2242024.07 | 68.6 | 46.8 | 50.9 | |
| CSwin-TBackbone=CSwin-T, Param=42M, FLOPs=279G, Framework=Mask-RCNN, Schedule=1x, Image size=(1280, 800)2024.03 | 68.6 | 46.7 | 51.3 | |
| PVTv2-B5Backbone=PVTv2-B5, Param=102M, FLOPs=557G, Framework=Mask-RCNN, Schedule=1x, Image size=(1280, 800)2024.03 | 68.6 | 47.4 | 51.9 | |
| MAEBackbone=ViT-B/16, Pre-training Dataset=L-20M, Pre-training Epochs=25, Fine-tuning Epochs=252023.01 | 68.6 | 48.1 | 52.9 | |
| MPVIT-SPara (M)=43, FLOPs (G)=268, Detector=Mask R-CNN, Schedule=1x2025.09 | 68.6 | 46.4 | 51.2 | |
| CSWin-TPara (M)=42, FLOPs (G)=279, Detector=Mask R-CNN, Schedule=1x2025.09 | 68.6 | 46.7 | 51.3 | |
| RDNet-TFramework=Mask-RCNN, Schedule=3x, Image size=1280x800, Param=43M, FLOPs=278G2024.03 | 68.5 | 47.5 | 52.1 | |
| Vanilla-VMamba-TBackbone=Vanilla-VMamba-T, Schedule=1x, Architecture=Mask R-CNN, Params=42M, FLOPs=286G2024.01 | 68.5 | 46.5 | 50.7 | |
| SLIPBackbone=ViT-B/16, Pre-training Dataset=L-20M, Pre-training Epochs=25, Fine-tuning Epochs=252023.01 | 68.5 | 46.5 | 51 | |
| FL-Swin-TPara (M)=49, FLOPs (G)=268, Detector=Mask R-CNN, Schedule=3x2025.09 | 68.5 | 46.5 | 50.8 | |
| DropPosvenue=Ours, eff. ep.=800, backbone=ViT-B/16, framework=Mask R-CNN, schedule=1x2023.09 | 68.3 | 47.7 | 52.8 | |
| DropPosPretrain Epoch=800, Pre-trained Data=IN1K, Resolution=224x2242024.07 | 68.3 | 47.7 | 52.8 | |
| FocalNet-S (SRF)Backbone=FocalNet-S (SRF), Param=49M, FLOPs=267G, Framework=Mask-RCNN, Schedule=1x, Image size=(1280, 800)2024.03 | 68.3 | 45.9 | 50.1 | |
| iiANET-LDetector=Mask R-CNN, Schedule=1x2024.07 | 68.3 | 45.8 | 51.7 | |
| MAEvenue=CVPR'22, eff. ep.=1600, backbone=ViT-B/16, framework=Mask R-CNN, schedule=1x, implementation=reproduced fine-tuning2023.09 | 68.2 | 47.3 | 52.5 | |
| FocalNet-T (LRF)Encoder size (M)=28.6, #Params. (M)=48.9, Framework=Mask R-CNN, Schedule=1x2023.11 | 68.2 | 46.1 | 50.6 | |
| Dilate-SDetector=Mask R-CNN, Schedule=1x2024.07 | 68.2 | 45.8 | 50.1 | |
| PVTv2-B3Encoder size (M)=45.2, #Params. (M)=64.9, Framework=Mask R-CNN, Schedule=1x2023.11 | 68.1 | 47 | 51.7 | |
| PVTv2-B3Backbone=PVTv2-B3, Param=65M, FLOPs=397G, Framework=Mask-RCNN, Schedule=1x, Image size=(1280, 800)2024.03 | 68.1 | 47 | 51.7 |