Object Detection on COCO (val)
68.3mAPDiff. Detector (DINO*)
Evaluation Results
| Method | Links | |||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Diff. Detector (DINO*)Training Scale=100% COCO, Framework=SD-1.5, Inf. time (ms)=2322025.06 | 68.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Diff. Detector (SD-1.5)Training Scale=100% COCO, Detector=Faster R-CNN, Inf. time (ms)=1642025.06 | 67 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ConvNeXt-BaseTraining Scale=100% COCO, Detector=Faster R-CNN, Inf. time (ms)=542025.06 | 64.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Diff. Detector (FCOS*)Training Scale=100% COCO, Framework=SD-1.5, Inf. time (ms)=1712025.06 | 64.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Classic Specialist (VLM)Model Category=Classic Specialist, Task-specific fine-tuning=true2026.01 | 63.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CMCPre-train Datasets=NTURGBD+COCO, Initialization Strategy=ImageNet pre-trained, Training Data Scale=Full Data2022.03 | 63.58 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HCMoCoPre-train Datasets=NTURGBD+MPII, Initialization Strategy=ImageNet pre-trained, Training Data Scale=Full Data2022.03 | 63.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Classic Specialist (Non-VLM)Model Category=Classic Specialist, Task-specific fine-tuning=true2026.01 | 63.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MMVPre-train Datasets=NTURGBD+MPII, Initialization Strategy=ImageNet pre-trained, Training Data Scale=Full Data2022.03 | 62.97 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HCMoCoPre-train Datasets=NTURGBD+COCO, Initialization Strategy=ImageNet pre-trained, Training Data Scale=Full Data2022.03 | 62.95 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CMCPre-train Datasets=NTURGBD+MPII, Initialization Strategy=ImageNet pre-trained, Training Data Scale=Full Data2022.03 | 62.76 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-BaseTraining Scale=100% COCO, Detector=Faster R-CNN, Inf. time (ms)=782025.06 | 62.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IN Pre-trainInitialization Strategy=ImageNet pre-trained, Training Data Scale=Full Data2022.03 | 62.66 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIP (Swin-Tiny)Training Scale=100% COCO, Detector=Faster R-CNN, Inf. time (ms)=312025.06 | 62 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-BaseTraining Scale=100% COCO, Detector=Faster R-CNN, Inf. time (ms)=552025.06 | 61.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HCMoCoPre-train Datasets=NTURGBD+MPII, Initialization Strategy=Random initialization, Training Data Scale=Full Data2022.03 | 61.33 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Co-DINO-Deformable-DETR++Backbone=Swin-L (IN-22K), Multi-scale=true, #query=900, #epochs=362022.11 | 60.7 | 78.5 | 66.7 | 45.1 | 64.7 | 76.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Co-DINO-Deformable-DETR++Backbone=Swin-L (IN-22K), Multi-scale=true, #query=900, #epochs=242022.11 | 60.4 | 78.3 | 66.4 | 44.6 | 64.2 | 76.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CMCPre-train Datasets=NTURGBD+MPII, Initialization Strategy=Random initialization, Training Data Scale=Full Data2022.03 | 60.33 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Co-DINO-Deformable-DETRBackbone=Swin-L (IN-22K), Multi-scale=true, #query=900, #epochs=362022.11 | 60 | 77.7 | 66.1 | 44.6 | 63.9 | 75.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MMVPre-train Datasets=NTURGBD+MPII, Initialization Strategy=Random initialization, Training Data Scale=Full Data2022.03 | 59.89 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Co-DINO-Deformable-DETRBackbone=Swin-L (IN-22K), Multi-scale=true, #query=900, #epochs=242022.11 | 59.8 | 77.7 | 65.5 | 43.6 | 63.5 | 75.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| H-Deformable-DETRframework=DETR, backbone=Swin-L, input size=1333 x 800, #epochs=36, evaluation=single-scale2022.07 | 59.4 | 77.8 | 65.4 | 43.1 | 63.1 | 74.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Co-DINO-Deformable-DETR++Backbone=Swin-L (IN-22K), Multi-scale=true, #query=900, #epochs=122022.11 | 59.3 | 77.3 | 64.9 | 43.3 | 63.3 | 75.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MOATframework=Cascade Mask R-CNN, backbone=MOAT-3, input size=1344 x 1344, #epochs=36, evaluation=single-scale2022.07 | 59.2 | 77.8 | 60.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CBNetV2framework=HTC, backbone=2x Swin-L, input size=1600 x 1400, #epochs=12, evaluation=single-scale2022.07 | 59.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Co-DINO-Deformable-DETRBackbone=Swin-L (IN-22K), Multi-scale=true, #query=900, #epochs=122022.11 | 58.9 | 76.9 | 64.8 | 42.6 | 62.7 | 75.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ScaleDet-B*Backbone=Swin-Base, Fine-tuned=true, Multi-dataset training=true2023.06 | 58.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DDQ DETR 4scalesBackbone=Swin-L, Epochs=302023.03 | 58.7 | 76.8 | 64.5 | 41.6 | 62.9 | 74.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINO-DETRframework=DETR, backbone=Swin-L, input size=1333 x 800, #epochs=36, evaluation=single-scale2022.07 | 58.5 | 77 | 64.1 | 41.5 | 62.3 | 74 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINO-Deformable-DETRBackbone=Swin-L (IN-22K), Multi-scale=true, #query=900, #epochs=36, Feature levels=52022.11 | 58.5 | 77 | 64.1 | 41.5 | 62.3 | 74 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Co-Deformable-DETRBackbone=Swin-L (IN-22K), Multi-scale=true, #query=900, #epochs=362022.11 | 58.5 | 77.1 | 64.5 | 42.4 | 62.4 | 74 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Group-DETRframework=DETR, backbone=Swin-L, input size=1333 x 800, #epochs=36, evaluation=single-scale2022.07 | 58.4 | — | — | 41 | 62.5 | 73.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Group-DINO-Deformable-DETRBackbone=Swin-L (IN-22K), Multi-scale=true, #query=900, #epochs=362022.11 | 58.4 | — | — | 41 | 62.5 | 73.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ResNet-R50Training Scale=100% COCO, Detector=Faster R-CNN, Inf. time (ms)=272025.06 | 58.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINO 4scalesBackbone=Swin-L, Epochs=362023.03 | 58 | 76.1 | 64 | 40.1 | 62.2 | 74.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| H-Deformable-DETRBackbone=Swin-L (IN-22K), Multi-scale=true, #query=900, #epochs=362022.11 | 57.9 | 76.8 | 63.6 | 42.4 | 61.9 | 73.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| H-Deformable DETR 4scalesBackbone=Swin-L, Epochs=362023.03 | 57.6 | 76.5 | 63.2 | 41.4 | 61.7 | 73.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| From ScratchInitialization Strategy=Random initialization, Training Data Scale=Full Data2022.03 | 57.27 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-L (HTC++)FLOPs=1470G, #parameters=284M2021.05 | 57.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swinframework=HTC, backbone=Swin-L, input size=1600 x 1200, #epochs=36, evaluation=single-scale2022.07 | 57.1 | 75.6 | 62.5 | 42.4 | 60.7 | 71.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cascade Eff-B7 NAS-FPN w/ self-training Copy-PasteInput image size=1280, FLOPs=1440B, # Params=185M, augmentation=Copy-Paste, training=self-training2020.12 | 57 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisionLLM v2Model Category=Vision-Centric VLM, Model Parameters=7B, Task-specific decoders (*)=true2026.01 | 56.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-B (HTC++)FLOPs=1043G, #parameters=160M2021.05 | 56.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cascade Eff-B7 NAS-FPN w/ Copy-PasteInput image size=1280, FLOPs=1440B, # Params=185M, augmentation=Copy-Paste2020.12 | 55.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MViTv2framework=Cascade Mask R-CNN, backbone=MViTv2-L, input size=1333 x 800, #epochs=50, evaluation=single-scale2022.07 | 55.8 | 74.3 | 64.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ScaleDet-BBackbone=Swin-Base, Fine-tuned=false, Multi-dataset training=true2023.06 | 55.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ConvNeXtframework=Cascade Mask R-CNN, backbone=ConvNeXt-XL, input size=1333 x 800, #epochs=36, evaluation=single-scale2022.07 | 55.2 | 74.2 | 59.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Co-DINO-Deformable-DETR++Backbone=R50, Multi-scale=true, #query=900, #epochs=362022.11 | 54.8 | 72.5 | 60.1 | 38.3 | 58.4 | 69.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cascade Eff-B7 NAS-FPNInput image size=1280, FLOPs=1440B, # Params=185M2020.12 | 54.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientDet-D7xInput image size=1536, FLOPs=410B, # Params=77M2020.12 | 54.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpineNet-190 (1280) w/ Self-training# FLOPs=1885B, # Params=164M, Image Size=1280, Self-training=true, Augmentation=Augment-S3, Unlabeled Data=Open Images Dataset (OID)2020.06 | 54.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpineNet-190 w/ self-trainingInput image size=1280, FLOPs=1885B, # Params=164M2020.12 | 54.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DDQ DETR 5scalesBackbone=ResNet-50, Epochs=24, Augmentation=480-8002023.03 | 52.8 | 69.9 | 58.1 | 37.4 | 55.7 | 66 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DDQ R-CNNBackbone=Swin-B, Epochs=362023.03 | 52.8 | 72.2 | 57.9 | 37.6 | 56.2 | 66.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpineNet-190† (1280)# FLOPs=1885B, # Params=164M, Image Size=1280, Augmentation=No Augment-S32020.06 | 52.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpineNet-190Input image size=1280, FLOPs=1885B, # Params=164M2020.12 | 52.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpineNet-143 (1280) w/ Self-training# FLOPs=524B, # Params=67M, Image Size=1280, Self-training=true, Augmentation=Augment-S3, Unlabeled Data=Open Images Dataset (OID)2020.06 | 52.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpineNet-190resolution=1536x1536, FLOPs=2076.8B, Params=176.2M, training_protocol=protocol C2019.12 | 52.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpineNet-190Input image size=1536, FLOPs=2076B, # Params=176M2020.12 | 52.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HCMoCoPre-train Datasets=NTURGBD+COCO, Initialization Strategy=ImageNet pre-trained, Training Data Scale=10% Data2022.03 | 52.18 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientDet-D7 (1536)# FLOPs=325B, # Params=52M, Image Size=15362020.06 | 52.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Co-DINO-Deformable-DETRBackbone=R50, Multi-scale=true, #query=900, #epochs=122022.11 | 52.1 | 69.4 | 57.1 | 35.4 | 55.4 | 65.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Co-DINO-Deformable-DETR++Backbone=R50, Multi-scale=true, #query=900, #epochs=122022.11 | 52.1 | 69.3 | 57.3 | 35.4 | 55.5 | 67.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Full PrecisionW/A/Attn=32/32/32, Detector=Cascade Mask R-CNN, Backbone=Swin-S2021.11 | 52 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DDQ DETR 4scalesBackbone=ResNet-50, Epochs=24, Augmentation=480-8002023.03 | 52 | 69.5 | 57.2 | 35.2 | 54.9 | 65.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-B (Mask R-CNN)FPS (V100/TitanRTX)=11.6/-, FLOPs=982G, #parameters=145M2021.05 | 51.9 | 70.9 | 56.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-S (Mask R-CNN)FPS (V100/TitanRTX)=12.0/-, FLOPs=838G, #parameters=107M2021.05 | 51.8 | 70.4 | 56.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cascade Mask R-CNNBackbone=Swin-S, #Param=107M, #FLOPs=838G2022.03 | 51.8 | 70.4 | 56.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CMCPre-train Datasets=NTURGBD+COCO, Initialization Strategy=ImageNet pre-trained, Training Data Scale=10% Data2022.03 | 51.77 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ELSA-SBackbone=ELSA-S, Framework=Cascade Mask R-CNN, Schedule=1x, Params=110M, FLOPs=846G2021.12 | 51.6 | 70.5 | 56 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DETABackbone=ResNet-50, Epochs=24, Training schedule=2x schedule, Number of encoder layers=9, Evaluation with top 300 predictions=true2022.12 | 51.6 | 69 | 56.7 | 34 | 55.8 | 66.5 | — | — | — | — | 10 | — | — | — | — | — | — | — | — | — | — | |
| OursSupervision=internet sourced image-text pairs, image-level labels for CB U CN, pseudo-box labels in CN, box-level labels in CB, Training Schedule=8x (~96 epochs)2022.07 | 51.5 | — | — | — | — | — | — | 56.6 | 36.9 | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cascade Mask R-CNNBackbone=SNN-MLP-S, #Param=107M, #FLOPs=825G2022.03 | 51.4 | 70 | 55.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FQ-ViTW/A/Attn=8/8/8, Detector=Cascade Mask R-CNN, Backbone=Swin-S2021.11 | 51.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViLD+Supervision=internet sourced image-text pairs, box-level labels in CB, Training Schedule=8x (~96 epochs)2022.07 | 51.3 | — | — | — | — | — | — | 59.5 | 27.6 | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOBackbone=ResNet-50, Epochs=24, Training schedule=2x schedule2022.12 | 51.3 | 69.1 | 56 | 34.5 | 54.2 | 65.8 | — | — | — | — | 5 | — | — | — | — | — | — | — | — | — | — | |
| DINO 5scalesBackbone=ResNet-50, Epochs=36, Augmentation=480-8002023.03 | 51.2 | 69 | 55.8 | 35 | 54.3 | 65.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINO-Deformable-DETRBackbone=R50, Multi-scale=true, #query=900, #epochs=36, Feature levels=52022.11 | 51.2 | 69 | 55.8 | 35 | 54.3 | 65.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cascade Mask R-CNNBackbone=AS-MLP-S, #Param=107M, #FLOPs=824G2022.03 | 51.1 | 69.8 | 55.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DETABackbone=ResNet-50, Epochs=24, Training schedule=2x schedule2022.12 | 51.1 | 68.5 | 56.4 | 34.3 | 55.4 | 65.4 | — | — | — | — | 13 | — | — | — | — | — | — | — | — | — | — | |
| DDQ R-CNNBackbone=ResNet-50, Epochs=36, Augmentation=480-800, Encoder=With Encoder2023.03 | 51 | 69 | 56 | 34 | 54.4 | 64.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpineNet-143† (1280)# FLOPs=524B, # Params=67M, Image Size=1280, Augmentation=No Augment-S32020.06 | 50.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINO 4scalesBackbone=ResNet-50, Epochs=36, Augmentation=480-8002023.03 | 50.9 | 69 | 55.3 | 34.6 | 54.1 | 64.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FQ-ViTW/A/Attn=8/8/4, Detector=Cascade Mask R-CNN, Backbone=Swin-S2021.11 | 50.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Sparse R-CNNBackbone=Swin-B, Epochs=362023.03 | 50.8 | 70.4 | 55.6 | 33.9 | 53.7 | 66 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AmoebaNet + NAS-FPN (+ learned augmentation, + anchors, + image size)Architecture=AmoebaNet + NAS-FPN, Change=+ learned augmentation, + anchors, + image size, # Scales=12019.06 | 50.7 | — | — | 34.2 | 55.5 | 64.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AmoebaNet+ NAS-FPN+AA (1536)# FLOPs=3045B, # Params=209M, Image Size=1536, Augmentation=AutoAugment2020.06 | 50.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MegDetArchitecture=MegDet, # Scales=multiple2019.06 | 50.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-T (Mask R-CNN)FPS (V100/TitanRTX)=15.3/-, FLOPs=745G, #parameters=86M2021.05 | 50.5 | 69.3 | 54.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cascade Mask R-CNNBackbone=Swin-T, #Param=86M, #FLOPs=745G2022.03 | 50.5 | 69.3 | 54.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DETABackbone=ResNet-50, Epochs=12, Training schedule=1x schedule, Number of encoder layers=9, Evaluation with top 300 predictions=true2022.12 | 50.5 | 67.6 | 55.3 | 33.1 | 54.7 | 65.2 | — | — | — | — | 10 | — | — | — | — | — | — | — | — | — | — | |
| Swin-SBackbone=Swin-S, Framework=Cascade Mask R-CNN, Schedule=1x, Params=107M, FLOPs=838G2021.12 | 50.3 | 69.7 | 54.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cascade Mask R-CNNBackbone=SNN-MLP-T, #Param=86M, #FLOPs=739G2022.03 | 50.3 | 68.9 | 54.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HCMoCoPre-train Datasets=NTURGBD+MPII, Initialization Strategy=ImageNet pre-trained, Training Data Scale=10% Data2022.03 | 50.29 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MMVPre-train Datasets=NTURGBD+MPII, Initialization Strategy=ImageNet pre-trained, Training Data Scale=10% Data2022.03 | 50.16 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cascade Mask R-CNNBackbone=AS-MLP-T, #Param=86M, #FLOPs=739G2022.03 | 50.1 | 68.8 | 54.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Detic-BBackbone=Swin-Base, Fine-tuned=false, Multi-dataset training=true2023.06 | 50.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MADBackbone=ViT-B, Parameter(M)=107M, Infer. Time(s)=0.262024.03 | 50.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| H-Deformable-DETRBackbone=ResNet-50, Epochs=362022.12 | 50 | 68.3 | 54.4 | 32.9 | 52.7 | 65.3 | — | — | — | — | 12 | — | — | — | — | — | — | — | — | — | — |