Instance Segmentation on LVIS
53mAP (Mask)APE-D*
Evaluation Results
| Method | Links | ||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| APE-D*training=partially trained on LVIS2025.11 | 53 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SAM 3Prompt Type=T (text-only)2025.11 | 52.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 54.7 | — | — | |
| OWL-ViT v2Pretraining Model=ViT-L/14, Pretraining Data=WebLI-10B + Objects365 + Visual Genome, Detector Backbone=ViT-L/14, Pseudo Box Labels=false2023.09 | 50.4 | — | — | — | 45.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLEE-ProType=Foundation Models2023.12 | 49.9 | — | — | — | 44.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SAM 32025.11 | 48.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 37.2 | — | |
| GLEE-PlusType=Foundation Models2023.12 | 47.4 | — | — | — | 40.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTDet-HEvaluation protocol=Zero-shot, Prompt=ViTDet-H boxes2023.12 | 46.6 | — | — | — | — | — | — | 35 | 58 | 66.3 | — | — | — | — | — | — | — | — | |
| T-Rex2Prompt Type=T (text-only)2025.11 | 45.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SAMEvaluation protocol=Zero-shot, Prompt=ViTDet-H boxes2023.12 | 44.7 | — | — | — | — | — | — | 32.5 | 57.6 | 65.5 | — | — | — | — | — | — | — | — | |
| OWLv2*training=partially trained on LVIS2025.11 | 43.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 29.3 | — | |
| EfficientSAM-SEvaluation protocol=Zero-shot, Prompt=ViTDet-H boxes2023.12 | 42.3 | — | — | — | — | — | — | 30.8 | 54 | 62.3 | — | — | — | — | — | — | — | — | |
| GLEE-LiteType=Foundation Models2023.12 | 40.2 | — | — | — | 33.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientSAM-TiEvaluation protocol=Zero-shot, Prompt=ViTDet-H boxes2023.12 | 39.9 | — | — | — | — | — | — | 28.9 | 51 | 59.9 | — | — | — | — | — | — | — | — | |
| DINO-X2025.11 | 38.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DITOPretraining Model=ViT-L/16, Pretraining Data=DataComp-1B, Detector Backbone=ViT-L/16, Pseudo Box Labels=false2023.09 | 38 | — | — | — | 40.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CFM-ViTPretraining Model=ViT-L/16, Pretraining Data=ALIGN-1.8B, Detector Backbone=ViT-L/16, Pseudo Box Labels=false2023.09 | 36.6 | — | — | — | 33.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CFM-ViTPretraining Model=ViT-L/16, Pretraining Data=LAION-2B, Detector Backbone=ViT-L/16, Pseudo Box Labels=false, Note=Reproduced result2023.09 | 36.4 | — | — | — | 33.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLMDet-L2025.11 | 36.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 35.1 | — | |
| DITOPretraining Model=ViT-L/16, Pretraining Data=LAION-2B, Detector Backbone=ViT-L/16, Pseudo Box Labels=false2023.09 | 36.2 | — | — | — | 37.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| F-VLMPretraining Model=R-50x64, Pretraining Data=CLIP-400M, Detector Backbone=R-50x64, Pseudo Box Labels=false2023.09 | 34.9 | — | — | — | 32.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| F-VLMBackbone=RN50x642026.02 | 34.9 | 32.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OWL-ViTPretraining Model=ViT-L/14, Pretraining Data=CLIP-400M + Objects365 + Visual Genome, Detector Backbone=ViT-L/14, Pseudo Box Labels=false2023.09 | 34.7 | — | — | — | 25.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastSAMEvaluation protocol=Zero-shot, Prompt=ViTDet-H boxes2023.12 | 34.5 | — | — | — | — | — | — | 24.6 | 46.2 | 50.8 | — | — | — | — | — | — | — | — | |
| MobileSAMEvaluation protocol=Zero-shot, Prompt=ViTDet-H boxes2023.12 | 34.4 | — | — | — | — | — | — | 23.8 | 44.9 | 53.7 | — | — | — | — | — | — | — | — | |
| F-ViT (+LazyStrike)Backbone=ViT-L/142026.02 | 34.3 | 32.1 | 34.4 | 35.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RO-ViTPretraining Model=ViT-L/16, Pretraining Data=LAION-2B, Detector Backbone=ViT-L/16, Pseudo Box Labels=false, Source=arXiv version2023.09 | 32.9 | — | — | — | 32.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Detic-CN2Pretraining Model=ViT-B/32, Pretraining Data=CLIP-400M + INet-21K, Detector Backbone=R-50, Pseudo Box Labels=Weak Supervision (WS)2023.09 | 32.4 | — | — | — | 24.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DITOPretraining Model=ViT-B/16, Pretraining Data=LAION-2B, Detector Backbone=ViT-B/16, Pseudo Box Labels=false2023.09 | 32.4 | — | — | — | 31.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RegionCLIPPretraining Model=R-50x4, Pretraining Data=CLIP-400M + CC3M, Detector Backbone=R-50x4, Pseudo Box Labels=true2023.09 | 32.3 | — | — | — | 22 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CFM-ViTPretraining Model=ViT-B/16, Pretraining Data=ALIGN-1.8B, Detector Backbone=ViT-B/16, Pseudo Box Labels=false2023.09 | 32 | — | — | — | 28.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CondHeadBackbone=RN50x4-C42022.12 | 32 | — | 31.6 | 35.9 | 24.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RILSBackbone=ViT-B/16, Pre-training Dataset=L-20M, Pre-training Epochs=25, Fine-tuning Epochs=252023.01 | 31.6 | — | — | — | — | 47.8 | 33.7 | — | — | — | — | — | — | — | — | — | — | — | |
| SLIPBackbone=ViT-B/16, Pre-training Dataset=L-20M, Pre-training Epochs=25, Fine-tuning Epochs=252023.01 | 30.8 | — | — | — | — | 46.5 | 32.6 | — | — | — | — | — | — | — | — | — | — | — | |
| CoDetPretraining Model=R-50, Pretraining Data=CLIP-400M + CC3M, Detector Backbone=R-50, Pseudo Box Labels=false2023.09 | 30.7 | — | — | — | 23.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RegionCLIP*Backbone=RN50x4-C4, re-evaluated with class-agnostic mask head=true2022.12 | 30.7 | — | 30.2 | 35.1 | 21.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MAE+CLIPBackbone=ViT-B/16, Pre-training Dataset=L-20M, Pre-training Epochs=25, Fine-tuning Epochs=252023.01 | 30.7 | — | — | — | — | 46.4 | 32.6 | — | — | — | — | — | — | — | — | — | — | — | |
| Kaul et al.Pretraining Model=ViT-B/32, Pretraining Data=CLIP-400M, Detector Backbone=R-50, Pseudo Box Labels=false2023.09 | 30.6 | — | — | — | 19.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIPBackbone=ViT-B/16, Pre-training Dataset=L-20M, Pre-training Epochs=25, Fine-tuning Epochs=252023.01 | 30.5 | — | — | — | — | 45.9 | 32.5 | — | — | — | — | — | — | — | — | — | — | — | |
| RO-ViTPretraining Model=ViT-B/16, Pretraining Data=ALIGN-1.8B, Detector Backbone=ViT-B/16, Pseudo Box Labels=false2023.09 | 30.2 | — | — | — | 28 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MAEBackbone=ViT-B/16, Pre-training Dataset=L-20M, Pre-training Epochs=25, Fine-tuning Epochs=252023.01 | 29.6 | — | — | — | — | 44 | 31.7 | — | — | — | — | — | — | — | — | — | — | — | |
| ViLD-EnsPretraining Model=EffNet-B7, Pretraining Data=ALIGN-1.8B, Detector Backbone=EffNet-B7, Pseudo Box Labels=false2023.09 | 29.3 | — | — | — | 26.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DITOPretraining Model=ViT-S/16, Pretraining Data=LAION-2B, Detector Backbone=ViT-S/16, Pseudo Box Labels=false2023.09 | 28.8 | — | — | — | 26.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| F-ViTBackbone=ViT-L/142026.02 | 28.7 | 24.2 | 27.9 | 31.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CondHeadBackbone=RN152-FPN2022.12 | 28.1 | — | 26.2 | 33 | 21.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CondHeadBackbone=RN50-C42022.12 | 27.9 | — | 27.3 | 32.2 | 20 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BARONPretraining Model=ViT-B/32, Pretraining Data=CLIP-400M, Detector Backbone=R-50, Pseudo Box Labels=false2023.09 | 27.6 | — | — | — | 22.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EdaDetPretraining Model=R-50, Pretraining Data=CLIP-400M, Detector Backbone=R-50, Pseudo Box Labels=false2023.09 | 27.5 | — | — | — | 23.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetPro-CascadePretraining Model=ViT-B/32, Pretraining Data=CLIP-400M, Detector Backbone=R-50, Pseudo Box Labels=false2023.09 | 27 | — | — | — | 20 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VL-PLMPretraining Model=ViT-B/32, Pretraining Data=CLIP-400M, Detector Backbone=R-50, Pseudo Box Labels=true2023.09 | 27 | — | — | — | 17.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViLD*Backbone=RN152-FPN, re-evaluated with class-agnostic mask head=true2022.12 | 26.9 | — | 25.1 | 32.1 | 19.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeticArchitecture=MaskRCNN-ResNet50, Training settings=from scratch, Additional Training Data=ImageNet-21K (IN-L), Model Setup=single model2022.01 | 26.8 | 17.8 | 26.3 | 31.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RegionCLIP*Backbone=RN50-C4, re-evaluated with class-agnostic mask head=true2022.12 | 26.7 | — | 26 | 31.6 | 17.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OV-DETR2022.03 | 26.6 | 17.4 | 25 | 32.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OV-DETRPretraining Model=ViT-B/32, Pretraining Data=CLIP-400M, Detector Backbone=R-50, Pseudo Box Labels=false2023.09 | 26.6 | — | — | — | 17.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OADBPretraining Model=ViT-B/32, Pretraining Data=CLIP-400M, Detector Backbone=R-50, Pseudo Box Labels=true2023.09 | 26.6 | — | — | — | 21.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CondHeadBackbone=RN50-FPN2022.12 | 26.4 | — | 26.2 | 29.9 | 19.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RasheedPretraining Model=ViT-B/32, Pretraining Data=CLIP-400M, Detector Backbone=R-50, Pseudo Box Labels=false2023.09 | 25.9 | — | — | — | 21.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViLD-ensembleArchitecture=MaskRCNN-ResNet50, Training settings=from scratch, Note=ensembling2022.01 | 25.5 | 16.6 | 24.6 | 30.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViLD-ens.Ensemble=true2022.03 | 25.5 | 16.6 | 24.6 | 30.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViLDBackbone=RN50-FPN, re-evaluated with class-agnostic mask head=false2022.12 | 25.5 | — | 24.6 | 30.3 | 16.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PromptDetPretraining Model=ViT-B/32, Pretraining Data=CLIP-400M, Detector Backbone=R-50, Pseudo Box Labels=true2023.09 | 25.3 | — | — | — | 21.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViLD*Backbone=RN50-FPN, re-evaluated with class-agnostic mask head=true2022.12 | 25.2 | — | 25 | 29.1 | 16.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViLD-textArchitecture=MaskRCNN-ResNet50, Training settings=from scratch2022.01 | 24.9 | 10.1 | 23.9 | 32.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViLD-text2022.03 | 24.9 | 10.1 | 23.9 | 32.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| F-VLMBackbone=RN502026.02 | 24.2 | 18.6 | 24 | 26.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Supervised + RFSBackbone=RN50-FPN2022.12 | 23.1 | — | 23.3 | 31 | 12.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViLDArchitecture=MaskRCNN-ResNet50, Training settings=from scratch, Note=uses distillation2022.01 | 22.5 | 16.1 | 20 | 28.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViLD2022.03 | 22.5 | 16.1 | 20 | 28.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SupervisedBackbone=RN50-FPN2022.12 | 21.8 | — | 22.8 | 32.7 | 4.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| F-ViT (+LazyStrike)Backbone=ViT-B/162026.02 | 21.7 | 22.8 | 18 | 25.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenSeeD (L)Training Data (SEG)=true, Training Data (DET)=true, Training Data (ITP)=false, Evaluation Protocol=Zero-shot, Backbone=Large2023.03 | 21 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenSeeD (T)Training Data (SEG)=true, Training Data (DET)=true, Training Data (ITP)=false, Evaluation Protocol=Zero-shot, Backbone=Tiny2023.03 | 19.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| F-ViTBackbone=ViT-B/162026.02 | 15.4 | 11.5 | 12.3 | 20.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GiT-HBackbone=Huge, Training=Universal2024.03 | 14.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GiT-LBackbone=Large, Training=Universal2024.03 | 11.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| X-Decoder (T)Training Data (SEG)=true, Training Data (DET)=false, Training Data (ITP)=true, Evaluation Protocol=Zero-shot, Backbone=Tiny2023.03 | 9.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GiT-BBackbone=Base, Training=Universal2024.03 | 8.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SAMSupervision=Supervised2024.02 | 6.7 | — | — | — | — | — | — | — | — | — | 46.1 | 31.1 | 71.3 | 74.6 | — | — | — | — | |
| HASSODSupervision=Self-supervised2024.02 | 4.2 | — | — | — | — | — | — | — | — | — | 22.5 | 12.7 | 36.1 | 47.8 | — | — | — | — | |
| CutLERSupervision=Self-supervised2024.02 | 3.6 | — | — | — | — | — | — | — | — | — | 20.2 | 11.3 | 31.1 | 46.2 | — | — | — | — | |
| FreeSOLOSupervision=Self-supervised2024.02 | 1.9 | — | — | — | — | — | — | — | — | — | 5.9 | 0.2 | 9.2 | 31.7 | — | — | — | — | |
| CORAPretraining Model=R-50x4, Pretraining Data=CLIP-400M, Detector Backbone=R-50x4, Pseudo Box Labels=true2023.09 | — | — | — | — | 22.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CutLERBackbone=RN-50, Number of Parameters=23M, Number of training images=1.3M, Zero-shot=true2024.06 | — | — | — | — | — | — | — | — | — | — | 20.2 | — | — | — | — | — | — | — | |
| FreeSOLOBackbone=RN-101, Number of Parameters=45M, Number of training images=1.3M, Zero-shot=true2024.06 | — | — | — | — | — | — | — | — | — | — | 5.9 | — | — | — | — | — | — | — | |
| gDino-T2025.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 14.7 | — | |
| Gemini 2.52025.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 13.4 | — | |
| iFS-RCNNTested on=iFSOD & iFSIS, Supervision level=Less2022.05 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 21.06 | — | — | — | |
| MAE2022.06 | — | — | — | — | 29.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask-RCNNTested on=gFSOD & gFSIS, Supervision level=More2022.05 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 18.31 | — | — | — | |
| Mask+SigmoidTested on=iFSOD & iFSIS, Supervision level=Less2022.05 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 19.18 | — | — | — | |
| Mask2FormerTrain Dataset=COCO, Task=PAN, Backbone=Swin-Large2024.02 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 24.38 | |
| Mask2FormerTrain Dataset=COCO, Task=ENT, Backbone=Swin-Large2024.02 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 27.75 | |
| Mask2FormerTrain Dataset=EntitySeg, Task=ENT, Backbone=Swin-Large2024.02 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 33.56 | |
| MoCo-v32022.06 | — | — | — | — | 25.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OWLv22025.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 20.1 | — | |
| SAM (supervised)Backbone=ViT-B/8, Number of Parameters=85M, Number of training images=11M, Zero-shot=true2024.06 | — | — | — | — | — | — | — | — | — | — | 46.1 | — | — | — | — | — | — | — | |
| SAM 3Prompt Type=I (image-only)2025.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 76 | — | — | |
| SAM 3Prompt Type=T+I (combined text and image)2025.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.4 | — | — | |
| SAM-HTrain Dataset=SAM-H [1], Task=Prompt, Backbone=Swin-Large2024.02 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 49.25 | |
| SiameseIM2022.06 | — | — | — | — | 30.1 | — | — | — | — | — | — | — | — | — | — | — | — | — |