Object Detection on COCO (mAP)
61.9mAPUni-Perceiver-v2 LARGE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Uni-Perceiver-v2 LARGEparameters=446M, task-specific fine-tuning=false2022.11 | 61.9 | — | — | |
| GRITBackbone=ViT-H, Include COCO data into training=true2024.04 | 60.4 | — | — | |
| Uni-Perceiver-v2 BASEparameters=308M, task-specific fine-tuning=false2022.11 | 58.6 | — | — | |
| DINOBackbone=Swin-L, Include COCO data into training=true2024.04 | 58.5 | — | — | |
| MM-G-T(c3)Backbone=Swin-T, Setting=close-set 1x2024.01 | 58.2 | — | — | |
| G-DINO-T(c)Backbone=Swin-T, Setting=close-set 1x2024.01 | 58.1 | — | — | |
| dBOTstudent backbone=ViT-L, teacher=CLIP-L [31], positional embedding=absolute2022.09 | 56.8 | — | — | |
| DyHeadBackbone=Swin-L, Include COCO data into training=true2024.04 | 56.2 | — | — | |
| ViT-L (random initialized)student backbone=ViT-L, teacher initialization=random2022.09 | 56 | — | — | |
| GLIPBackbone=Swin-T, Setting=close-set 1x2024.01 | 55.4 | — | — | |
| FAN-L-HybridEncoder Size=76.8M, Detector=Cascade Mask R-CNN, Pre-trained=ImageNet-22K2022.04 | 55.1 | — | — | |
| MM-G-T(c3)Backbone=Swin-T, Setting=open-set 1x2024.01 | 54.7 | — | — | |
| FAN-L-HybridEncoder Size=76.8M, Detector=Cascade Mask R-CNN2022.04 | 54.1 | — | — | |
| dBOTstudent backbone=ViT-B, teacher=CLIP-B [31], positional embedding=absolute2022.09 | 53.6 | — | — | |
| FAN-S-HybridEncoder Size=26.3M, Detector=Cascade Mask R-CNN2022.04 | 53.3 | — | — | |
| ViT-B (random initialized)student backbone=ViT-B, teacher initialization=random2022.09 | 52.7 | — | — | |
| GLIPBackbone=Swin-L, Include COCO data into training=true2024.04 | 51.4 | — | — | |
| MM-G-T(c2)Backbone=Swin-T, Setting=zero-shot2024.01 | 50.6 | — | — | |
| MM-G-T(c1)Backbone=Swin-T, Setting=zero-shot2024.01 | 50.5 | — | — | |
| MM-G-T(c3)Backbone=Swin-T, Setting=zero-shot2024.01 | 50.4 | — | — | |
| FAN-T-HybridEncoder Size=7.4M, Detector=Cascade Mask R-CNN2022.04 | 50.2 | — | — | |
| DINOBackbone=R-50, Setting=close-set 1x2024.01 | 50.1 | — | — | |
| FAN-S-HybridEncoder Size=26.3M, Detector=Mask R-CNN2022.04 | 49.1 | — | — | |
| DetCLIPv3Backbone=Swin-L, Include COCO data into training=false2024.04 | 48.5 | — | — | |
| G-DINO-T(c)Backbone=Swin-T, Setting=zero-shot2024.01 | 48.4 | — | — | |
| Attn. bias + Ours (Specialization)Backbone=ViT-L, Framework=DINOv2, Attention Bias=true2026.02 | 48.2 | — | — | |
| MixPLDetector=FCOS2023.12 | 47.6 | — | — | |
| DetCLIPv3Backbone=Swin-T, Include COCO data into training=false2024.04 | 47.2 | — | — | |
| ScaleDetBackbone=ResNet-50, Training Datasets=LVIS, COCO, Objects365, OpenImages (OID), Training Data Size=3.7M2023.06 | 47.1 | — | — | |
| ScaleDetBackbone=ResNet-50, Training Datasets=LVIS, COCO, Objects365, Training Data Size=1.96M2023.06 | 47 | — | — | |
| Ours (Specialization)Backbone=ViT-L, Framework=DINOv2, Attention Bias=false2026.02 | 46.8 | — | — | |
| Attn. bias + CaiTBackbone=ViT-L, Framework=DINOv2, Attention Bias=true2026.02 | 46.8 | — | — | |
| GLIPBackbone=Swin-T, Setting=zero-shot2024.01 | 46.6 | — | — | |
| Pix2Seq v2parameters=132M, task-specific fine-tuning=false2022.11 | 46.5 | — | — | |
| Dense TeacherDetector=FCOS2023.12 | 46.1 | — | — | |
| GLIPBackbone=Swin-T, Include COCO data into training=true2024.04 | 46.1 | — | — | |
| Swin-TEncoder Size=28.0M, Detector=Mask R-CNN2022.04 | 46 | — | — | |
| Attn. bias baselineBackbone=ViT-L, Framework=DINOv2, Attention Bias=true2026.02 | 46 | — | — | |
| FAN-T-HybridEncoder Size=7.4M, Detector=Mask R-CNN2022.04 | 45.8 | — | — | |
| DINOv2 baseline (∅)Backbone=ViT-L, Framework=DINOv2, Attention Bias=false2026.02 | 45.6 | — | — | |
| ScaleDetBackbone=ResNet-50, Training Datasets=LVIS, COCO2023.06 | 44.9 | — | — | |
| DINOPretraining=Standard image pretraining, Pretraining Dataset=ImageNet2022.10 | 44.3 | — | — | |
| SupervisedPretraining=Supervised, Pretraining Dataset=ImageNet2022.10 | 44.2 | — | — | |
| VITOPretraining=Video pretraining, Pretraining Dataset=VideoNet2022.10 | 44 | — | — | |
| DeticBackbone=ResNet-50, Training Datasets=LVIS, COCO2023.06 | 43.9 | — | — | |
| MOCLRPretraining=Standard image pretraining, Pretraining Dataset=ImageNet2022.10 | 43.9 | — | — | |
| DSLDetector=FCOS2023.12 | 43.8 | — | — | |
| BYOLPretraining=Standard image pretraining, Pretraining Dataset=ImageNet2022.10 | 43.7 | — | — | |
| CaiTBackbone=ViT-L, Framework=DINOv2, Attention Bias=false2026.02 | 43.1 | — | — | |
| CPUBone-B3Backbone=CPUBone-B3, Pi5 CPU Latency=1181.6, Resolution=512x512, Detection Head=RetinaNet, Training Schedule=1x2026.03 | 42.9 | — | — | |
| CycleConPretraining=Video pretraining, Pretraining Dataset=R2V22022.10 | 42.8 | — | — | |
| FAT-B1Backbone=FAT-B1, Pi5 CPU Latency=1102.1, Resolution=512x512, Detection Head=RetinaNet, Training Schedule=1x2026.03 | 42.5 | — | — | |
| DeticBackbone=ResNet-50, Training Datasets=LVIS, COCO, ImageNet21k, Training Data Size=12.6M2023.06 | 42.4 | — | — | |
| TOODBackbone=R-50, Setting=close-set 1x2024.01 | 42.4 | — | — | |
| VINCEPretraining=Video pretraining, Pretraining Dataset=R2V22022.10 | 42.4 | — | — | |
| ResNet101Encoder Size=44.1M, Detector=Mask R-CNN2022.04 | 41.8 | — | — | |
| VFSPretraining=Video pretraining, Pretraining Dataset=K4002022.10 | 41.6 | — | — | |
| LowFormer-B2Backbone=LowFormer-B2, Pi5 CPU Latency=808.1, Resolution=512x512, Detection Head=RetinaNet, Training Schedule=1x2026.03 | 41.4 | — | — | |
| ISyNet-N32021.09 | 41.3 | — | — | |
| VIVIPretraining=Video pretraining, Pretraining Dataset=YT8M2022.10 | 41.3 | — | — | |
| MMV-VAPretraining=Video pretraining, Pretraining Dataset=AS + HT2022.10 | 41.3 | — | — | |
| PVTv2-B1Backbone=PVTv2-B1, Pi5 CPU Latency=1296.4, Resolution=512x512, Detection Head=RetinaNet, Training Schedule=1x2026.03 | 41.2 | — | — | |
| Det-AdvpropModel=YOLOv3-416 [66], Training Strategy=Det-Advprop2022.09 | 40.69 | — | — | |
| EdgeViT-XSBackbone=EdgeViT-XS, Pi5 CPU Latency=461.5, Resolution=512x512, Detection Head=RetinaNet, Training Schedule=1x2026.03 | 40.6 | — | — | |
| DATModel=YOLOv3-416 [66], Training Strategy=DAT (Ours)2022.09 | 40.41 | — | — | |
| FAT-B0Backbone=FAT-B0, Pi5 CPU Latency=763.3, Resolution=512x512, Detection Head=RetinaNet, Training Schedule=1x2026.03 | 40.4 | — | — | |
| CPUBone-B2Backbone=CPUBone-B2, Pi5 CPU Latency=338.2, Resolution=512x512, Detection Head=RetinaNet, Training Schedule=1x2026.03 | 40.4 | — | — | |
| Cascade R-CNNBackbone=R-50, Setting=close-set 1x2024.01 | 40.3 | — | — | |
| NormalModel=YOLOv3-416 [66], Training Strategy=Normal2022.09 | 40.3 | — | — | |
| DeiT-SEncoder Size=22.1M, Detector=Mask R-CNN2022.04 | 40 | — | — | |
| ResNet-50Encoder Size=25.4M, Detector=Mask R-CNN2022.04 | 39.9 | — | — | |
| ISyNet-N1-S32021.09 | 39.4 | — | — | |
| ResNet-50+2021.09 | 39.4 | — | — | |
| ATSSBackbone=R-50, Setting=close-set 1x2024.01 | 39.4 | — | — | |
| LowFormer-B1Backbone=LowFormer-B1, Pi5 CPU Latency=313.2, Resolution=512x512, Detection Head=RetinaNet, Training Schedule=1x2026.03 | 39.4 | — | — | |
| ISyNet-N22021.09 | 39.3 | — | — | |
| ResNet-34+2021.09 | 39.1 | — | — | |
| RandomPretraining=Random2022.10 | 39 | — | — | |
| CPUBone-B1Backbone=CPUBone-B1, Pi5 CPU Latency=189.9, Resolution=512x512, Detection Head=RetinaNet, Training Schedule=1x2026.03 | 39 | — | — | |
| PaPE2026.02 | 38.9 | — | — | |
| RoPE2026.02 | 38.8 | — | — | |
| EdgeViT-XXSBackbone=EdgeViT-XXS, Pi5 CPU Latency=281.0, Resolution=512x512, Detection Head=RetinaNet, Training Schedule=1x2026.03 | 38.7 | — | — | |
| LowFormer-B0Backbone=LowFormer-B0, Pi5 CPU Latency=226.9, Resolution=512x512, Detection Head=RetinaNet, Training Schedule=1x2026.03 | 38.6 | — | — | |
| LBCModel=Faster-RCNN, Backbone=ResNet-50, N:M Pattern=2:42022.06 | 38.5 | — | — | |
| ISyNet-N1-S22021.09 | 38.4 | — | — | |
| SR-STEModel=Faster-RCNN, Backbone=ResNet-50, N:M Pattern=2:42022.06 | 38.2 | — | — | |
| ISyNet-N1-S12021.09 | 38 | — | — | |
| RoPE-Mixed2026.02 | 38 | — | — | |
| ISyNet-N12021.09 | 37.5 | — | — | |
| CPUBone-B0Backbone=CPUBone-B0, Pi5 CPU Latency=131.5, Resolution=512x512, Detection Head=RetinaNet, Training Schedule=1x2026.03 | 37.5 | — | — | |
| Faster-RCNN BaselineModel=Faster-RCNN, Backbone=ResNet-50, N:M Pattern=None2022.06 | 37.4 | — | — | |
| Faster R-CNNBackbone=R-50, Setting=close-set 1x2024.01 | 37.4 | — | — | |
| LBCModel=Faster-RCNN, Backbone=ResNet-50, N:M Pattern=2:82022.06 | 37.3 | — | — | |
| LookHere2026.02 | 37.3 | — | — | |
| SR-STEModel=Faster-RCNN, Backbone=ResNet-50, N:M Pattern=2:82022.06 | 37.2 | — | — | |
| PVTv2-B0Backbone=PVTv2-B0, Pi5 CPU Latency=587.7, Resolution=512x512, Detection Head=RetinaNet, Training Schedule=1x2026.03 | 37.2 | — | — | |
| ISyNet-N02021.09 | 36.6 | — | — | |
| YOLOS-S BaselineModel=YOLOS-S, Total GPU hours=1,193h2024.03 | 36.1 | — | — | |
| DATModel=YOLOv3-320 [66], Training Strategy=DAT (Ours)2022.09 | 36.02 | — | — | |
| YOLOS-S + ToEModel=YOLOS-S, r1=0.5, Total GPU hours=964h, Training Speedup=1.24x2024.03 | 36 | — | — |