Object Detection on COCO (APb)
52.4APbGLID
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GLIDType=Generalist, Backbone=Swin-L, Data=ImageNet-1K, w/ Labels=false2024.04 | 52.4 | — | |
| SiameseIM2022.06 | 52.1 | — | |
| MAE2022.06 | 51.6 | — | |
| iBOTArch.=ViT-B/162021.11 | 51.2 | — | |
| iBOTIntermediate Fine-tuning=False, Task head=Cascaded Mask R-CNN, Training schedule=1x2022.03 | 51.2 | — | |
| mc-BEiTIntermediate Fine-tuning=True (ImageNet-1K), Task head=Cascaded Mask R-CNN, Training schedule=1x2022.03 | 51.2 | — | |
| GLIDType=Generalist, Backbone=Swin-B, Data=ImageNet-1K, w/ Labels=false2024.04 | 51.2 | — | |
| BEITIntermediate Fine-tuning=True (ImageNet-1K), Task head=Cascaded Mask R-CNN, Training schedule=1x2022.03 | 50.7 | — | |
| BEiTArch.=ViT-B/162021.11 | 50.1 | — | |
| DINOArch.=ViT-B/162021.11 | 50.1 | — | |
| DINOIntermediate Fine-tuning=False, Task head=Cascaded Mask R-CNN, Training schedule=1x2022.03 | 50.1 | — | |
| mc-BEiTIntermediate Fine-tuning=False, Task head=Cascaded Mask R-CNN, Training schedule=1x2022.03 | 50.1 | — | |
| SupervisedArch.=ViT-B/162021.11 | 49.8 | — | |
| BEITIntermediate Fine-tuning=False, Task head=Cascaded Mask R-CNN, Training schedule=1x2022.03 | 49.6 | — | |
| iBOTArch.=ViT-S/16, Param.=212021.11 | 49.4 | — | |
| SupervisedArch.=Swin-T, Param.=292021.11 | 48.1 | — | |
| MoBYArch.=Swin-T, Param.=292021.11 | 48.1 | — | |
| SupervisedIntermediate Fine-tuning=False, Task head=Cascaded Mask R-CNN, Training schedule=1x2022.03 | 47.9 | — | |
| MoCo v3Intermediate Fine-tuning=False, Task head=Cascaded Mask R-CNN, Training schedule=1x2022.03 | 47.9 | — | |
| MoCo-v32022.06 | 47.9 | — | |
| Deformable-DETRType=Specialist, Backbone=ResNet50-DC5, w/ Labels=true2024.04 | 46.9 | — | |
| Pix2seq v2Type=Generalist, Backbone=ViT-B, Data=Objects365, w/ Labels=true2024.04 | 46.5 | — | |
| SupervisedArch.=ViT-S/16, Param.=212021.11 | 46.2 | — | |
| DETRType=Specialist, Backbone=ResNet101-DCN, w/ Labels=true2024.04 | 44.9 | — | |
| CoKeBackbone=R50-FPN, Evaluation Protocol=fine-tuning, multi-crop training trick=false2021.05 | 40.9 | — | |
| CoKeMulti-crop training trick=false2021.05 | 40.9 | — | |
| UniTType=Generalist, Backbone=ResNet50, Data=COCO, VG, VQAv2, w/ Labels=true2024.04 | 40.8 | — | |
| BYOLBackbone=R50-FPN, Evaluation Protocol=fine-tuning, multi-crop training trick=false2021.05 | 40.5 | — | |
| BYOLMulti-crop training trick=false2021.05 | 40.5 | — | |
| SwAVBackbone=R50-FPN, Evaluation Protocol=fine-tuning, multi-crop training trick=true2021.05 | 40.4 | — | |
| SwAVMulti-crop training trick=true2021.05 | 40.4 | — | |
| DINOBackbone=R50-FPN, Evaluation Protocol=fine-tuning, multi-crop training trick=true2021.05 | 40.2 | — | |
| DINOMulti-crop training trick=true2021.05 | 40.2 | — | |
| Barlow TwinsBackbone=R50-FPN, Evaluation Protocol=fine-tuning, multi-crop training trick=false2021.05 | 40.1 | — | |
| Barlow TwinsMulti-crop training trick=false2021.05 | 40.1 | — | |
| MoCo-v2Backbone=R50-FPN, Evaluation Protocol=fine-tuning, multi-crop training trick=false2021.05 | 39.6 | — | |
| MoCo-v2Multi-crop training trick=false2021.05 | 39.6 | — | |
| SupervisedBackbone=R50-FPN, Evaluation Protocol=fine-tuning, multi-crop training trick=false2021.05 | 38.9 | — | |
| SupervisedMulti-crop training trick=false2021.05 | 38.9 | — | |
| Mask-RCNNType=Specialist, Backbone=ResNeXt-1012024.04 | 37.1 | — | |
| VICRegL alpha = 0.75Backbone=R502022.10 | 25.7 | — | |
| DenseCLBackbone=R502022.10 | 24.8 | — | |
| VICRegBackbone=R502022.10 | 24 | — | |
| MoCo v2Backbone=R502022.10 | 23.8 | — | |
| BEiTpre-train dataset=DALLE-IN-1K, pre-train epochs=800, Backbone=ViT-B, Framework=Mask R-CNN, Training schedule=1x (12 epochs), Input scale=single-scale2021.11 | — | 46.3 | |
| DEiTpre-train dataset=IN-1K, pre-train epochs=300, Backbone=ViT-B, Framework=Mask R-CNN, Training schedule=1x (12 epochs), Input scale=single-scale2021.11 | — | 44.1 | |
| MAEpre-train dataset=IN-1K, pre-train epochs=800, Backbone=ViT-B, Framework=Mask R-CNN, Training schedule=1x (12 epochs), Input scale=single-scale2021.11 | — | 46.8 | |
| MAEpre-train dataset=IN-1K, pre-train epochs=1600, Backbone=ViT-B, Framework=Mask R-CNN, Training schedule=1x (12 epochs), Input scale=single-scale2021.11 | — | 47.2 | |
| MoCopre-train dataset=IN-1K, pre-train epochs=300, Backbone=ViT-B, Framework=Mask R-CNN, Training schedule=1x (12 epochs), Input scale=single-scale2021.11 | — | 44.9 | |
| PeCopre-train dataset=IN-1K, pre-train epochs=800, Backbone=ViT-B, Framework=Mask R-CNN, Training schedule=1x (12 epochs), Input scale=single-scale2021.11 | — | 47.8 |