Object Detection on LVIS v1.0 (val)
63.2APbboxInternImages
Evaluation Results
| Method | Links | ||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| InternImagesDetector=DINO, D_det=O365, Backbone=DCNv3-H, Params=2.2B, D_backbone=Laion-400M + YFCC-15M + CC12M2023.10 | 63.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EVAtest-scale=single-scale2022.11 | 62.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EVAEvaluation Scale=single-scale, Input Resolution=1280x12802022.11 | 62.2 | — | — | — | — | 1.9 | — | — | — | — | — | — | — | — | — | — | |
| EVADetector=CMask R-CNN, D_det=O365, Backbone=EVA-H, Params=1.1B, D_backbone=IN-21K + O365 + COCO + ADE20K + CC15M2023.10 | 62.2 | 55.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RichSemDetector=DINO, D_det=O365, Backbone=Focal-H, Params=747M, D_backbone=IN-22k2023.10 | 61.2 | 61.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RegionSpot-Pro↑336Training Data=O365, OI, V3D, Proposals=GT, Times=0.20k, Resolution=3362023.11 | 59.9 | 55.4 | — | 68.6 | — | — | — | — | — | — | — | — | — | — | — | — | |
| RARMLLM Backbone=InternLM-XC22024.03 | 57.1 | 60.2 | 58 | 54.3 | — | — | — | — | — | — | — | — | — | — | — | — | |
| RegionSpot-ProTraining Data=O365, OI, V3D, Proposals=GT, Times=0.18k2023.11 | 56.6 | 50.6 | — | 68.8 | — | — | — | — | — | — | — | — | — | — | — | — | |
| RARMLLM Backbone=Qwen-VL2024.03 | 56.4 | 59.6 | 57.5 | 53.7 | — | — | — | — | — | — | — | — | — | — | — | — | |
| RARMLLM Backbone=LLaVA1.52024.03 | 56.2 | 58.7 | 57.9 | 54.4 | — | — | — | — | — | — | — | — | — | — | — | — | |
| DECOLA Phase 2Backbone=Swin-L, Data=O365, LVIS-base, IN-21K2023.11 | 55.2 | — | 56 | — | — | — | 46.9 | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3+FTBackbone=Swin-L, Pre-training data=O365, V3Det, GoldG, GranuCap50M, Fine-tuning data=LVISbase2024.04 | 54.1 | 45.8 | 55.4 | 56.4 | — | — | — | — | — | — | — | — | — | — | — | — | |
| RichSemBackbone=Focal-L, Schedule=3x, Extra data=Additional extra data2023.10 | 53.6 | 52.8 | 52.6 | 55.2 | — | — | — | 67.2 | 56.7 | — | — | — | — | — | — | — | |
| ViTDetBackbone=ViT-H, pre-train=1K, MAE2022.03 | 53.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTDet-H2022.11 | 53.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTDet-H2022.11 | 53.4 | — | — | — | — | 7.9 | — | — | — | — | — | — | — | — | — | — | |
| DINO / ViTDet-H (Prev. Best)2022.11 | 53.4 | — | — | — | — | 9.8 | — | — | — | — | — | — | — | — | — | — | |
| ViTDetDetector=CMask R-CNN, D_det=None, Backbone=VIT-H-MAE, Params=692M, D_backbone=IN-1K2023.10 | 53.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTDetBackbone=ViT-H-MAE, Schedule=~8x, Source=Paper reported2023.10 | 53.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIP-L↑336* w/ maskTraining Data=O365, OI, V3D, Proposals=GT, Times=0.30k, Finetuned with Adapter=true2023.11 | 53.1 | 46.8 | — | 63.2 | — | — | — | — | — | — | — | — | — | — | — | — | |
| RegionSpot-LiteTraining Data=O365, OI, V3D, Proposals=GT, Times=0.18k2023.11 | 53 | 42 | — | 65.6 | — | — | — | — | — | — | — | — | — | — | — | — | |
| RichSemBackbone=Swin-L, Schedule=2x, Extra data=Additional extra data2023.10 | 52 | 50.2 | 51.5 | 53.3 | — | — | — | 65.7 | 54.8 | — | — | — | — | — | — | — | |
| RichSemExtra External Data=ImageNet-21K Labels, Base Detector=DINO + CLIP, Backbone=Swin-L2024.12 | 52 | 50.2 | 51.5 | 53.3 | — | — | — | — | — | — | — | — | — | — | — | — | |
| baseline + self-trainBackbone=Swin-L, Data=O365, LVIS-base, IN-21K2023.11 | 51.8 | — | 53.5 | — | — | — | 36.5 | — | — | — | — | — | — | — | — | — | |
| MAWSDataset=IG-3B, Arch.=ViTDet-2B, Framework=Cascade2023.03 | 51.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RichSemBackbone=Focal-L, Schedule=1x, Extra data=Additional extra data2023.10 | 51.5 | 52.3 | 50.7 | 52 | — | — | — | 65.2 | 54.4 | — | — | — | — | — | — | — | |
| MAEDataset=IN1k, Arch.=ViTDet-H, Framework=Cascade2023.03 | 51.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SimLTD MixPLExtra External Data=COCO-unlabeled2017, Base Detector=DINO, Backbone=Swin-L, GPU Hrs=11682024.12 | 51.5 | 45 | 52.4 | 53.3 | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gen-n-ValBase Detector=CenterNet22025.06 | 51.5 | 55.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RichSemBackbone=Focal-L, Schedule=3x2023.10 | 51.4 | 47.6 | 49.8 | 54.9 | — | — | — | 64.8 | 54.2 | — | — | — | — | — | — | — | |
| ViTDetBackbone=ViT-L, pre-train=1K, MAE2022.03 | 51.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTDetBackbone=ViT-L-MAE, Schedule=~8x, Source=Paper reported2023.10 | 51.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DiverGenBackbone=Swin-L2024.05 | 51.2 | 50.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DiverGenBase Detector=CenterNet22025.06 | 51.2 | 50.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CenterNet2 w/ X-Paste + Copy-PasteBackbone=Swin-L2022.12 | 50.9 | — | — | — | — | — | 48.7 | — | — | — | — | — | — | — | — | — | |
| MAWSDataset=IG-3B, Arch.=ViTDet-H, Framework=Cascade2023.03 | 50.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RegionCLIPZero-shot evaluation protocol=true2024.03 | 50.7 | 50.1 | 50.1 | 51.7 | — | — | — | — | — | — | — | — | — | — | — | — | |
| OWLv2Backbone=Swin-L, Data=O365, LVIS-base, VG, WebLI2023.11 | 50.4 | — | — | — | — | — | 45.9 | — | — | — | — | — | — | — | — | — | |
| CenterNet2 w/ X-PasteBackbone=Swin-L2022.12 | 50.1 | — | — | — | — | — | 48.2 | — | — | — | — | — | — | — | — | — | |
| X-PasteBackbone=Swin-L2024.05 | 50.1 | 48.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| XPasteBase Detector=CenterNet22025.06 | 50.1 | 48.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RichSemBackbone=Swin-L, Schedule=1x, Extra data=Additional extra data2023.10 | 49.8 | 48.6 | 49.7 | 50.5 | — | — | — | 63.7 | 52.5 | — | — | — | — | — | — | — | |
| SimLTD SupervisedBase Detector=DINO, Backbone=Swin-L, GPU Hrs=4602024.12 | 49.8 | 42.4 | 50.4 | 52.4 | — | — | — | — | — | — | — | — | — | — | — | — | |
| RichSemBackbone=Swin-L, Schedule=2x2023.10 | 49.7 | 42.8 | 49.2 | 53.4 | — | — | — | 62.9 | 52.4 | — | — | — | — | — | — | — | |
| RichSemBase Detector=DINO, Backbone=Swin-L2024.12 | 49.7 | 42.8 | 49.2 | 53.4 | — | — | — | — | — | — | — | — | — | — | — | — | |
| baselineBackbone=Swin-L, Data=O365, LVIS-base2023.11 | 49.6 | — | 53.3 | — | — | — | 21.9 | — | — | — | — | — | — | — | — | — | |
| CenterNet2 w/ Copy-PasteBackbone=Swin-L2022.12 | 49.5 | — | — | — | — | — | 43.4 | — | — | — | — | — | — | — | — | — | |
| RichSemBackbone=Focal-L, Schedule=1x2023.10 | 49.5 | 47.3 | 47.7 | 52.4 | — | — | — | 62.5 | 52.2 | — | — | — | — | — | — | — | |
| CLIP-L↑336 w/ maskProposals=GT, Resolution=3362023.11 | 49.5 | 43.2 | — | 59.9 | — | — | — | — | — | — | — | — | — | — | — | — | |
| OWL-ST+FTBackbone=CLIP L/14, Pre-training data=WebLI2B, Fine-tuning data=LVISbase2024.04 | 49.4 | 44.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIP-L w/ maskProposals=GT2023.11 | 49.2 | 40.8 | — | 59.6 | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIPInput strategy=mask2024.03 | 49.2 | 40.8 | 53.5 | 59.6 | — | — | — | — | — | — | — | — | — | — | — | — | |
| SimLTD MixPLExtra External Data=COCO-unlabeled2017, Base Detector=DINO, Backbone=Swin-B, GPU Hrs=7942024.12 | 49 | 43.4 | 49 | 51.5 | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIP-L w/ boxProposals=GT2023.11 | 48.7 | 40.6 | — | 59.2 | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIPInput strategy=box2024.03 | 48.7 | 40.6 | 53.1 | 59.2 | — | — | — | — | — | — | — | — | — | — | — | — | |
| DECOLABackbone=Swin-B, Detector Architecture=CenterNet2, labels=DECOLA labels2023.11 | 48.5 | 47.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RichSemBackbone=Swin-B, Schedule=2x, Extra data=Additional extra data2023.10 | 48.2 | 46.5 | 46.5 | 51 | — | — | — | 61.6 | 51 | — | — | — | — | — | — | — | |
| DetCLIPv3+FTBackbone=Swin-T, Pre-training data=O365, V3Det, GoldG, GranuCap50M, Fine-tuning data=LVISbase2024.04 | 48.2 | 40.2 | 48.5 | 51.3 | — | — | — | — | — | — | — | — | — | — | — | — | |
| RichSemExtra External Data=ImageNet-21K Labels, Base Detector=DINO + CLIP, Backbone=Swin-B2024.12 | 48.2 | 46.5 | 46.5 | 51 | — | — | — | — | — | — | — | — | — | — | — | — | |
| CenterNet2Backbone=Swin-L2022.12 | 47.5 | — | — | — | — | — | 41.4 | — | — | — | — | — | — | — | — | — | |
| CenterNet2Backbone=Swin-L2024.05 | 47.5 | 41.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CenterNet2Base Detector=CenterNet22025.06 | 47.5 | 41.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SimLTD SupervisedBase Detector=DINO, Backbone=Swin-B, GPU Hrs=4142024.12 | 47.2 | 42.7 | 46.7 | 49.9 | — | — | — | — | — | — | — | — | — | — | — | — | |
| SWAGDataset=IG-3.6B, Arch.=ViTDet-H, Framework=Cascade2023.03 | 47.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RichSemBackbone=Swin-L, Schedule=1x2023.10 | 47 | 41.2 | 45.9 | 50.7 | — | — | — | 59.9 | 49.6 | — | — | — | — | — | — | — | |
| DeticBackbone=Swin-B2022.12 | 46.9 | — | — | — | — | — | 45.9 | — | — | — | — | — | — | — | — | — | |
| Detic-CenterNet2+Backbone=Swin-B, Schedule=4x2023.10 | 46.9 | 45.8 | 45.5 | 49 | — | — | — | 62.2 | 49.4 | — | — | — | — | — | — | — | |
| DeticBackbone=Swin-B, Detector Architecture=CenterNet22023.11 | 46.9 | 45.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeticBackbone=Swin-B2024.05 | 46.9 | 45.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DECOLA labelsbackbone=Swin-B2023.11 | 46.7 | — | — | — | — | — | 38.4 | — | — | — | — | — | — | — | — | — | |
| RichSemBackbone=Swin-B, Schedule=2x2023.10 | 46.4 | 38.5 | 45.1 | 51.3 | — | — | — | 59.2 | 48.9 | — | — | — | — | — | — | — | |
| RichSemExtra External Data=N/A, Base Detector=DINO, Backbone=Swin-B2024.12 | 46.4 | 38.5 | 45.1 | 51.3 | — | — | — | — | — | — | — | — | — | — | — | — | |
| DECOLA Phase 2Backbone=Swin-B, Data=LVIS-base, IN-21K2023.11 | 46.3 | — | 47.5 | — | — | — | 35.7 | — | — | — | — | — | — | — | — | — | |
| Deticbackbone=Swin-B2023.11 | 45.7 | — | — | — | — | — | 36.6 | — | — | — | — | — | — | — | — | — | |
| Detic-CenterNet2Backbone=Swin-B, Schedule=4x2023.10 | 45.4 | 39.9 | 44.5 | 48.9 | — | — | — | 59.9 | 47.9 | — | — | — | — | — | — | — | |
| Detic-baseBackbone=Swin-B, Detector Architecture=CenterNet22023.11 | 45.4 | 39.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| 3Waysbackbone=NFNet-F62023.11 | 44.6 | — | — | — | — | — | 30.1 | — | — | — | — | — | — | — | — | — | |
| DITOBackbone=Swin-L, Data=O365, LVIS-base, DataComp-1B2023.11 | 44.2 | — | — | — | — | — | 45.8 | — | — | — | — | — | — | — | — | — | |
| Detic-basebackbone=Swin-B2023.11 | 43 | — | — | — | — | — | 24.6 | — | — | — | — | — | — | — | — | — | |
| SimLTD MixPLExtra External Data=COCO-unlabeled2017, Base Detector=DINO, Backbone=Swin-T, GPU Hrs=4822024.12 | 42.5 | 35.7 | 42.4 | 45.6 | — | — | — | — | — | — | — | — | — | — | — | — | |
| baseline + self-trainBackbone=Swin-B, Data=LVIS-base, IN-21K2023.11 | 42.3 | — | 43.6 | — | — | — | 30.8 | — | — | — | — | — | — | — | — | — | |
| DiffusionDetBase Detector=4 @ 300, Backbone=Swin-B2024.12 | 42 | 34.8 | 40.9 | 46.4 | — | — | — | — | — | — | — | — | — | — | — | — | |
| OWL-ST+FTBackbone=CLIP B/16, Pre-training data=WebLI2B, Fine-tuning data=LVISbase2024.04 | 41.8 | 36.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientNet-B7 NAS-FPNInput image size=1280, Augmentation=Copy-Paste2020.12 | 41.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Copy-Paste2022.11 | 41.6 | — | — | — | — | 15.4 | — | — | — | — | — | — | — | — | — | — | |
| Copy-PasteBackbone=EfficientNet-B72022.12 | 41.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RichSemBackbone=Swin-T, Schedule=2x, Extra data=Additional extra data2023.10 | 41.6 | 37.3 | 39.7 | 45.5 | — | — | — | 53.3 | 43.8 | — | — | — | — | — | — | — | |
| Copy-PasteBackbone=EfficientNet-B72024.05 | 41.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RichSemExtra External Data=ImageNet-21K Labels, Base Detector=DINO + CLIP, Backbone=Swin-T2024.12 | 41.6 | 37.3 | 39.7 | 45.5 | — | — | — | — | — | — | — | — | — | — | — | — | |
| LaMI-DETRPretrained Model=ConVNext-L, Detector Backbone=ConVNext-L, Backbone Size=196M, Image-level Dataset=X2024.07 | 41.3 | 43.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LVIS Challenge 2020 WinnerTest-time augmentation=None2020.12 | 41.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| baselineBackbone=Swin-B, Data=LVIS-base2023.11 | 41.1 | — | 43.8 | — | — | — | 16.2 | — | — | — | — | — | — | — | — | — | |
| SimLTD SupervisedBase Detector=DINO, Backbone=Swin-T, GPU Hrs=3102024.12 | 41.1 | 33.6 | 40.1 | 45.4 | — | — | — | — | — | — | — | — | — | — | — | — | |
| SiameseIMEpochs=16002022.06 | 40.5 | 30.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MAEEpochs=16002022.06 | 40.1 | 29.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RichSemBackbone=ResNet-50, Schedule=2x, Extra data=Mixed extra data2023.10 | 40.1 | 36.2 | 38.2 | 44 | — | — | — | 51.9 | 42.3 | — | — | — | — | — | — | — | |
| DetCLIPv3Backbone=Swin-L, Pre-training data=O365, V3Det, GoldG, GranuCap50M, Fine-tuning data=None (Zero-shot)2024.04 | 39.6 | 38.9 | 38.4 | 41.3 | — | — | — | — | — | — | — | — | — | — | — | — | |
| FRACALBackbone=Swin-B, Schedule=1x, Architecture=Mask R-CNN2024.10 | 39.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SimLTD MixPLExtra External Data=COCO-unlabeled2017, Base Detector=DINO, Backbone=R50, GPU Hrs=4462024.12 | 39.4 | 32.6 | 38.5 | 43.6 | — | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientNet-B7 FPNInput image size=1024, Augmentation=Copy-Paste2020.12 | 39.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |