Instance Segmentation on MS COCO (val)
51APSoft Teacher + Swin-L
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Soft Teacher + Swin-LBackbone=Swin-L, Test-time augmentation=false2022.04 | 51 | — | — | — | — | — | |
| Swin TransformerPre-training=ImageNet-22K, Test-time augmentation=false2022.04 | 49.5 | — | — | — | — | — | |
| Self-training Copy-PasteTraining Strategy=Self-training, Data Augmentation=Copy-Paste, Test-time augmentation=false2022.04 | 48.9 | — | — | — | — | — | |
| Cascade Eff-B7 NAS-FPN (1280) with Copy-Paste and frozen backboneBackbone=EfficientNet-B7, Resolution=1280, Architecture=Cascade NAS-FPN, Data Augmentation=Copy-Paste, Backbone freezing=true, Test-time augmentation=false2022.04 | 48.7 | — | — | — | — | — | |
| Cascade Eff-B7 NAS-FPN (1280) with frozen backboneBackbone=EfficientNet-B7, Resolution=1280, Architecture=Cascade NAS-FPN, Backbone freezing=true, Test-time augmentation=false2022.04 | 47.6 | — | — | — | — | — | |
| Cascade Eff-B7 NAS-FPN (1280) with Copy-PasteBackbone=EfficientNet-B7, Resolution=1280, Architecture=Cascade NAS-FPN, Data Augmentation=Copy-Paste, Test-time augmentation=false2022.04 | 47.2 | — | — | — | — | — | |
| Cascade Eff-B7 NAS-FPN (1280)Backbone=EfficientNet-B7, Resolution=1280, Architecture=Cascade NAS-FPN, Test-time augmentation=false2022.04 | 46.9 | — | — | — | — | — | |
| AN (w/ BN)Architecture=AOGNet40M, Normalization=Attentive Normalization with BN, Framework=Cascade Mask R-CNN, Head #Params=92.58M2019.08 | 40 | 62.3 | 43.1 | — | — | — | |
| AN (w/ BN)Architecture=ResNet101, Normalization=Attentive Normalization with BN, Framework=Cascade Mask R-CNN, Head #Params=96.77M2019.08 | 39.6 | 61.7 | 42.7 | — | — | — | |
| BNArchitecture=AOGNet40M, Normalization=Batch Normalization, Framework=Cascade Mask R-CNN, Head #Params=92.35M2019.08 | 39.3 | 61.2 | 42.7 | — | — | — | |
| BNArchitecture=ResNet101, Normalization=Batch Normalization, Framework=Cascade Mask R-CNN, Head #Params=96.32M2019.08 | 38.2 | 59.7 | 41.3 | — | — | — | |
| Mask R-CNNsupervision=Full2021.03 | 35.4 | 57.3 | 37.5 | — | — | — | |
| BBAMsupervision=Box2021.03 | 26 | 50 | 23.9 | — | — | — | |
| +DnA (A_h^{Q ± V ±})Resolution=224 x 224, Training epochs=50, Pre-trained weights=supervised ViT-B2026.06 | 22.8 | 39.4 | 22.9 | — | — | — | |
| ViT-Det-BResolution=224 x 224, Training epochs=50, Pre-trained weights=supervised ViT-B2026.06 | 22.7 | 38.9 | 22.9 | — | — | — | |
| Hsu et al.supervision=Box2021.03 | 21.1 | 45.5 | 17.2 | — | — | — | |
| Laradji et al.supervision=Image label, Point2021.03 | 7.8 | 18.2 | 8.8 | — | — | — | |
| Shen et al.supervision=Image label2021.03 | 6.1 | 11.7 | 5.5 | — | — | — | |
| C-JEPABackbone=ViT-T/16, Pretrain Epoch=100, Evaluation Protocol=Fine-tuning2024.10 | — | — | — | 30.9 | 51.4 | 32.2 | |
| C-JEPABackbone=ViT-S/16, Pretrain Epoch=100, Evaluation Protocol=Fine-tuning2024.10 | — | — | — | 37.1 | 57.5 | 39.2 | |
| DeiT-IIIBackbone=ViT-B, Architecture=Cascaded Mask R-CNN, Training Recipe=ViTDet2023.06 | — | — | — | 43.6 | — | — | |
| I-JEPABackbone=ViT-T/16, Pretrain Epoch=100, Evaluation Protocol=Fine-tuning2024.10 | — | — | — | 29.1 | 49.5 | 30.6 | |
| I-JEPABackbone=ViT-S/16, Pretrain Epoch=100, Evaluation Protocol=Fine-tuning2024.10 | — | — | — | 35.2 | 56.3 | 37.3 | |
| MaskSubBackbone=ViT-B, Architecture=Cascaded Mask R-CNN, Training Recipe=ViTDet, Base Model=DeiT-III2023.06 | — | — | — | 43.9 | — | — | |
| YOLO-Master-seg-NSize=6402025.12 | — | — | — | 35.6 | — | — | |
| YOLOv11-seg-NSize=6402025.12 | — | — | — | 32 | — | — | |
| YOLOv12-seg-NSize=6402025.12 | — | — | — | 32.8 | — | — |