Instance Segmentation on COCO 2017 v1.0 (val)
51.2Mask APSwinV2-L
Evaluation Results
| Method | Links | |
|---|---|---|
| SwinV2-LPre-training Dataset=IN21k, Architecture=SwinV2-L, Framework=HTC++2023.03 | 51.2 | |
| CBNetv2Pre-training Dataset=IN21k, Architecture=2 xSwin-L, Framework=HTC2023.03 | 51 | |
| MAEPre-training Dataset=IN1k, Architecture=ViTDet-H, Framework=Cascade2023.03 | 50.9 | |
| MAWSPre-training Dataset=IG-3B, Architecture=ViTDet-2B, Framework=Cascade2023.03 | 50.1 | |
| MAWSPre-training Dataset=IG-3B, Architecture=ViTDet-H, Framework=Cascade2023.03 | 49.6 | |
| RevColV2-BFramework=Cascade Mask R-CNN, Params=156M2023.09 | 47.9 | |
| SWAGPre-training Dataset=IG-3.6B, Architecture=ViTDet-H, Framework=Cascade2023.03 | 47.9 | |
| RevColV2-LFramework=Mask R-CNN, Params=363M2023.09 | 47.8 | |
| MAE-LFramework=Mask R-CNN, Backbone=ViT-L, Architecture Adapter=ViT-Adapter, Params=330M2023.09 | 47.4 | |
| MAE-LFramework=Mask R-CNN, Backbone=ViT-L, Params=323M2023.09 | 47.1 | |
| EVA-02-B++Framework=Cascade Mask R-CNN, Pre-training=ImageNet-22K, Distillation Teacher=true, Params=141M2023.09 | 47.1 | |
| ViTDet-BFramework=Cascade Mask R-CNN, Params=141M2023.09 | 46.7 | |
| RevColV2-BFramework=Mask R-CNN, Params=119M2023.09 | 46.2 | |
| RevColFramework=Cascade Mask R-CNN, Params=196M2023.09 | 45.9 | |
| ConvNeXt-BFramework=Cascade Mask R-CNN, Params=146M2023.09 | 45.7 | |
| MAE-BFramework=Mask R-CNN, Backbone=ViT-B, Architecture Adapter=ViT-Adapter, Params=122M2023.09 | 45.4 | |
| Swin-BFramework=Cascade Mask R-CNN, Params=145M2023.09 | 45 | |
| MAE-BFramework=Mask R-CNN, Backbone=ViT-B, Params=110M2023.09 | 44.3 |