Object Detection on Objects365 (val)
76.2mAPScaleDet-B
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| ScaleDet-BBackbone=Swin-Base, Fine-tuned=false, Multi-dataset training=true2023.06 | 76.2 | — | — | — | — | — | — | — | — | — | |
| ScaleDet-B*Backbone=Swin-Base, Fine-tuned=true, Multi-dataset training=true2023.06 | 75.9 | — | — | — | — | — | — | — | — | — | |
| Detic-BBackbone=Swin-Base, Fine-tuned=false, Multi-dataset training=true2023.06 | 54.6 | — | — | — | — | — | — | — | — | — | |
| APE (D)Backbone=ViT-L2023.12 | 49.2 | — | — | — | — | — | — | — | — | — | |
| APE (B)Backbone=ViT-L2023.12 | 47.2 | — | — | — | — | — | — | — | — | — | |
| APE (C)Backbone=ViT-L2023.12 | 46.4 | — | — | — | — | — | — | — | — | — | |
| APE (A)Backbone=ViT-L2023.12 | 46 | — | — | — | — | — | — | — | — | — | |
| GLIPBackbone=Swin-L2023.12 | 36.2 | — | — | — | — | — | — | — | — | — | |
| Mr. DETR++Backbone=ResNet-50, Epochs=4, Queries=900, baseline=Deformable-DETR++2024.12 | 34.9 | 45.4 | 38.2 | — | 18.3 | 34.3 | 45.7 | — | — | — | |
| UniDetBackbone=ResNeSt2002021.02 | 33.7 | — | — | — | — | — | — | — | — | — | |
| Mr. DETRBackbone=ResNet-50, Epochs=4, Queries=900, baseline=Deformable-DETR++2024.12 | 32.7 | 42.7 | 35.8 | — | 17.1 | 32.3 | 42.6 | — | — | — | |
| CACascade RCNNNote=2019 Object365 detection challenge winner2021.02 | 31.6 | — | — | — | — | — | — | — | — | — | |
| Deformable-DETR++Backbone=ResNet-50, Epochs=4, Queries=9002024.12 | 30.4 | 40.8 | 33.1 | — | 16.1 | 30.1 | 39.1 | — | — | — | |
| LVDor (DeCLIP)Backbone=ViT-L/14, Modality=Fused, Train Data=LVIS-base2026.05 | 26.1 | 42 | — | — | — | — | — | — | 24.3 | — | |
| SupervisedBackbone=ResNet-50, Training=from scratch2021.04 | 25.6 | 38.6 | 28 | — | — | — | — | — | — | — | |
| SupervisedPre-Train Data=N/A, zero-shot=false2024.03 | 25.6 | — | — | — | — | — | — | — | — | — | |
| SupervisedTraining dataset=Standard Supervised Labels2024.06 | 25.6 | 38.6 | 28 | — | 16 | 28.1 | 36.7 | — | — | — | |
| SupervisedTraining=Supervised on target dataset2022.12 | 25.6 | 38.6 | 28 | — | — | — | — | — | — | — | |
| Supervised BaselineTraining dataset=LVIS2025.05 | 25.6 | 38.6 | 28 | — | — | — | — | — | — | — | |
| LVDor (DeCLIP)Backbone=ViT-L/14, Modality=Text, Train Data=LVIS-base2026.05 | 25.4 | 41.2 | — | — | — | — | — | — | 23.7 | — | |
| DeCLIP + NoOVDBackbone=ViT-L/14, Training Data=LVIS-base2026.03 | 25.3 | 41.1 | — | — | — | — | — | 23.3 | — | — | |
| LVDor (CLIPSelf)Backbone=ViT-L/14, Modality=Fused, Train Data=LVIS-base2026.05 | 25.2 | 41.4 | — | — | — | — | — | — | 23.8 | — | |
| DVtor (DeCLIP)Backbone=ViT-L/14, Training Data=LVIS-base2025.08 | 25 | 40.9 | — | — | — | — | — | 23.7 | — | — | |
| LVDor (CLIPSelf)Backbone=ViT-L/14, Modality=Text, Train Data=LVIS-base2026.05 | 24.9 | 40.9 | — | — | — | — | — | — | 23.1 | — | |
| CLIPSelf + NoOVDBackbone=ViT-L/14, Training Data=LVIS-base2026.03 | 24.6 | 40.2 | — | — | — | — | — | 22.8 | — | — | |
| DeCLIP + F-ViTBackbone=ViT-L/14, Training Data=LVIS-base2026.03 | 24.5 | 39.8 | — | — | — | — | — | 22.3 | — | — | |
| F-ViT (DeCLIP)Backbone=ViT-L/14, Training Data=LVIS-base2025.08 | 24.5 | 39.8 | — | — | — | — | — | 22.3 | — | — | |
| F-ViT (DeCLIP)Backbone=ViT-L/14, Modality=Text, Train Data=LVIS-base2026.05 | 24.5 | 39.8 | — | — | — | — | — | — | 22.3 | — | |
| DVtor (CLIPSelf)Backbone=ViT-L/14, Training Data=LVIS-base2025.08 | 24 | 39.7 | — | — | — | — | — | 22.3 | — | — | |
| LVDor (DeCLIP)Backbone=ViT-L/14, Modality=Image, Train Data=LVIS-base2026.05 | 23.8 | 39.8 | — | — | — | — | — | — | 22.7 | — | |
| CLIPSelf + F-ViTBackbone=ViT-L/14, Training Data=LVIS-base2026.03 | 23.7 | 39.2 | — | — | — | — | — | 21.7 | — | — | |
| F-ViT (CLIPSelf)Backbone=ViT-L/14, Training Data=LVIS-base2025.08 | 23.7 | 39.2 | — | — | — | — | — | 21.7 | — | — | |
| F-ViT (CLIPSelf)Backbone=ViT-L/14, Modality=Text, Train Data=LVIS-base2026.05 | 23.7 | 39.2 | — | — | — | — | — | — | 21.7 | — | |
| LVDor (CLIPSelf)Backbone=ViT-L/14, Modality=Image, Train Data=LVIS-base2026.05 | 23.6 | 39.4 | — | — | — | — | — | — | 22.5 | — | |
| UNINEXTBackbone=ViT-H2023.12 | 23 | — | — | — | — | — | — | — | — | — | |
| CenterNet2Backbone=Res50-1x, Training strategy=multi-scale training, Sampling strategy=class-aware sampling2021.03 | 22.6 | 31.6 | 24.6 | 56 | — | — | — | — | — | — | |
| CascadeRCNNBackbone=Res50-1x, Training strategy=multi-scale training, Sampling strategy=class-aware sampling2021.03 | 21.7 | 31.7 | 23.4 | 67 | — | — | — | — | — | — | |
| DeCLIP + NoOVDBackbone=ViT-B/16, Training Data=LVIS-base2026.03 | 21.1 | 34 | — | — | — | — | — | 19 | — | — | |
| DVtor (DeCLIP)Backbone=ViT-B/16, Training Data=LVIS-base2025.08 | 21.1 | 35.4 | — | — | — | — | — | 18.7 | — | — | |
| LVDor (DeCLIP)Backbone=ViT-B/16, Modality=Fused, Train Data=LVIS-base2026.05 | 20.9 | 34.9 | — | — | — | — | — | — | 19.6 | — | |
| LVDor (DeCLIP)Backbone=ViT-B/16, Modality=Text, Train Data=LVIS-base2026.05 | 20.6 | 34.5 | — | — | — | — | — | — | 19.2 | — | |
| LVDor (CLIPSelf)Backbone=ViT-B/16, Modality=Fused, Train Data=LVIS-base2026.05 | 20.4 | 34.3 | — | — | — | — | — | — | 19.1 | — | |
| DeCLIP + F-ViTBackbone=ViT-B/16, Training Data=LVIS-base2026.03 | 20.2 | 33.1 | — | — | — | — | — | 17.6 | — | — | |
| F-ViT (DeCLIP)Backbone=ViT-B/16, Training Data=LVIS-base2025.08 | 20.2 | 33.1 | — | — | — | — | — | 17.6 | — | — | |
| F-ViT (DeCLIP)Backbone=ViT-B/16, Modality=Text, Train Data=LVIS-base2026.05 | 20.2 | 33.1 | — | — | — | — | — | — | 17.6 | — | |
| LVDor (CLIPSelf)Backbone=ViT-B/16, Modality=Text, Train Data=LVIS-base2026.05 | 20.1 | 33.9 | — | — | — | — | — | — | 18.5 | — | |
| DeCLIPTraining dataset=LVIS2025.05 | 20 | 32.2 | 21.2 | — | — | — | — | — | — | — | |
| CLIPSelf + NoOVDBackbone=ViT-B/16, Training Data=LVIS-base2026.03 | 19.6 | 33 | — | — | — | — | — | 18.3 | — | — | |
| LVDor (DeCLIP)Backbone=ViT-B/16, Modality=Image, Train Data=LVIS-base2026.05 | 19.6 | 33 | — | — | — | — | — | — | 17.1 | — | |
| CLIPSelfTraining dataset=LVIS2025.05 | 19.5 | 31.3 | 20.7 | — | — | — | — | — | — | — | |
| DVtor (CLIPSelf)Backbone=ViT-B/16, Training Data=LVIS-base2025.08 | 19.2 | 32.8 | — | — | — | — | — | 17.5 | — | — | |
| LVDor (CLIPSelf)Backbone=ViT-B/16, Modality=Image, Train Data=LVIS-base2026.05 | 19.2 | 32.8 | — | — | — | — | — | — | 16.5 | — | |
| CLIPSelf + F-ViTBackbone=ViT-B/16, Training Data=LVIS-base2026.03 | 19 | 32.3 | — | — | — | — | — | 16.8 | — | — | |
| F-ViT (CLIPSelf)Backbone=ViT-B/16, Training Data=LVIS-base2025.08 | 19 | 32.3 | — | — | — | — | — | 16.8 | — | — | |
| F-ViT (CLIPSelf)Backbone=ViT-B/16, Modality=Text, Train Data=LVIS-base2026.05 | 19 | 32.3 | — | — | — | — | — | — | 16.8 | — | |
| GFLBackbone=Res50-1x, Training strategy=multi-scale training, Sampling strategy=class-aware sampling2021.03 | 18.8 | 28.1 | 20.2 | 56 | — | — | — | — | — | — | |
| CenterNet*Backbone=Res50-1x, Training strategy=multi-scale training, Sampling strategy=class-aware sampling2021.03 | 18.7 | 27.5 | 20.1 | 55 | — | — | — | — | — | — | |
| LVDor (CLIP)Backbone=RN50x4, Modality=Fused, Train Data=LVIS-base2026.05 | 18.1 | 26.9 | — | — | — | — | — | — | 15 | — | |
| DVtor (CLIP)Backbone=RN50x16, Training Data=LVIS-base2025.08 | 17.9 | 27.6 | — | — | — | — | — | 16.2 | — | — | |
| LVDor (CLIP)Backbone=RN50x4, Modality=Text, Train Data=LVIS-base2026.05 | 17.9 | 26.7 | — | — | — | — | — | — | 14.8 | — | |
| RO-VITTraining dataset=LVIS2025.05 | 17.7 | 27.4 | 19.1 | — | — | — | — | — | — | — | |
| LVDor (CLIP)Backbone=RN50x4, Modality=Image, Train Data=LVIS-base2026.05 | 17.5 | 26.3 | — | — | — | — | — | — | 14.2 | — | |
| MM-OVODBackbone=RN50*, Training Data=LVIS-all + IN-L2026.03 | 16.6 | 23.1 | — | — | — | — | — | 13.1 | — | — | |
| MM-OVODBackbone=RN50∗, Training Data=LVIS-all + IN-L2025.08 | 16.6 | 23.1 | — | — | — | — | — | 13.1 | — | — | |
| MM-OVODBackbone=RN50, Modality=Text, Train Data=LVIS-all + IN-L2026.05 | 16.6 | 23.1 | — | — | — | — | — | — | 13.1 | — | |
| F-VLMTraining dataset=LVIS2025.05 | 16.2 | 27.4 | 17.5 | — | — | — | — | — | — | — | |
| F-VLM (CLIP)Backbone=RN50x16, Training Data=LVIS-base2025.08 | 16.2 | 25.3 | — | — | — | — | — | 14.9 | — | — | |
| DeticBackbone=RN50*, Training Data=LVIS-all + IN-L2026.03 | 15.6 | 22.2 | — | — | — | — | — | 12.4 | — | — | |
| DeticBackbone=RN50∗, Training Data=LVIS-all + IN-L2025.08 | 15.6 | 22.2 | — | — | — | — | — | 12.4 | — | — | |
| DeticBackbone=RN50*, Modality=Text, Train Data=LVIS-all + IN-L2026.05 | 15.6 | 22.2 | — | — | — | — | — | — | 12.4 | — | |
| LVDor (CLIP)Backbone=RN50, Modality=Fused, Train Data=LVIS-base2026.05 | 15.6 | 23.9 | — | — | — | — | — | — | 11.9 | — | |
| OWL-ViTBackbone=ViT-H/14, Image-level=LiT, Object-level=OI, VG, Resolution=8402022.05 | 15.5 | 24 | — | — | — | — | — | — | — | — | |
| FinetuningBackbone=ResNet-502021.04 | 15.2 | 23.9 | 16.2 | — | — | — | — | — | — | — | |
| LVDor (CLIP)Backbone=RN50, Modality=Text, Train Data=LVIS-base2026.05 | 15.2 | 23.7 | — | — | — | — | — | — | 11.4 | — | |
| MM-OVODBackbone=RN50*, Training Data=LVIS-all2026.03 | 14.8 | 21 | — | — | — | — | — | 10.1 | — | — | |
| MM-OVODBackbone=RN50∗, Training Data=LVIS-all2025.08 | 14.8 | 21 | — | — | — | — | — | 10.1 | — | — | |
| MM-OVODBackbone=RN50, Modality=Text, Train Data=LVIS-all2026.05 | 14.8 | 21 | — | — | — | — | — | — | 10.1 | — | |
| LBPTraining dataset=OV-LVIS, learnable prompt templates=true2024.06 | 14.3 | 21.8 | 15.1 | — | 5.5 | 13.7 | 21.6 | — | — | — | |
| CoDetTraining dataset=LVIS2025.05 | 14.2 | 20.5 | 15.3 | — | — | — | — | — | — | — | |
| F-VLM (CLIP)Backbone=RN50x4, Modality=Text, Train Data=LVIS-base2026.05 | 14.2 | 22.6 | — | — | — | — | — | — | — | — | |
| DeticBackbone=RN50*, Training Data=LVIS-all2026.03 | 13.9 | 19.7 | — | — | — | — | — | 9.5 | — | — | |
| DeticBackbone=RN50∗, Training Data=LVIS-all2025.08 | 13.9 | 19.7 | — | — | — | — | — | 9.5 | — | — | |
| DeticBackbone=RN50*, Modality=Text, Train Data=LVIS-all2026.05 | 13.9 | 19.7 | — | — | — | — | — | — | 9.5 | — | |
| OWL-ViTBackbone=ViT-L/16, Image-level=LiT, Object-level=OI, VG, Resolution=6722022.05 | 13.7 | 21.6 | — | — | — | — | — | — | — | — | |
| LVDor (CLIP)Backbone=RN50, Modality=Image, Train Data=LVIS-base2026.05 | 13.7 | 22.4 | — | — | — | — | — | — | 11 | — | |
| BARONTraining dataset=OV-LVIS, learnable prompt templates=true2024.06 | 13.6 | 21 | 14.5 | — | 5 | 13.1 | 20.7 | — | — | — | |
| BARONTraining dataset=LVIS2025.05 | 13.6 | 21 | 14.5 | — | — | — | — | — | — | — | |
| CondHeadTraining=LVIS, Evaluation=Cross-dataset transfer2022.12 | 13.2 | 20.4 | 14.2 | — | — | — | — | — | — | — | |
| DetProTraining dataset=OV-LVIS, Source=Reported from DetPro [4]2024.06 | 12.1 | 18.8 | 12.9 | — | 4.5 | 11.5 | 18.6 | — | — | — | |
| DetProTraining dataset=LVIS2025.05 | 12.1 | 18.8 | 12.9 | — | — | — | — | — | — | — | |
| F-VLM (CLIP)Backbone=RN50, Modality=Text, Train Data=LVIS-base2026.05 | 11.9 | 19.2 | — | — | — | — | — | — | — | — | |
| ViLDBackbone=ResNet-50, Training Data=LVIS2021.04 | 11.8 | 18.2 | 12.6 | — | — | — | — | — | — | — | |
| ViLDBackbone=ResNet50, Image-level=CLIP, Object-level=LVIS base, Resolution=10242022.05 | 11.8 | 18.2 | — | — | — | — | — | — | — | — | |
| ViLDTraining=LVIS, Evaluation=Cross-dataset transfer2022.12 | 11.8 | 18.2 | 12.6 | — | — | — | — | — | — | — | |
| ViLDTraining dataset=LVIS2025.05 | 11.8 | 18 | 12.6 | — | — | — | — | — | — | — | |
| ViLDTraining dataset=OV-LVIS, Source=Reported from DetPro [4]2024.06 | 11.5 | 17.8 | 12.3 | — | 4.2 | 11.1 | 17.8 | — | — | — | |
| OWL-ViTBackbone=R26+B/32, Image-level=LiT, Object-level=OI, VG, Resolution=7682022.05 | 11.1 | 17.4 | — | — | — | — | — | — | — | — | |
| OWL-ViTBackbone=ViT-B/16, Image-level=LiT, Object-level=OI, VG, Resolution=7682022.05 | 10.7 | 17 | — | — | — | — | — | — | — | — | |
| GenerateUPre-Train Data=VG, GRIT, zero-shot=true2024.03 | 10.5 | — | — | — | — | — | — | — | — | — | |
| ViLD-textBackbone=ResNet-50, Training Data=LVIS2021.04 | 10.4 | 15.8 | 11.1 | — | — | — | — | — | — | — |