Instance Segmentation on COCO (APm, APm@.50, APm@.75)
45.9AP^mTransNeXt-Base
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| TransNeXt-BaseEncoder size (M)=89.7, #Params. (M)=109.2, Framework=Mask R-CNN, Schedule=1x2023.11 | 45.9 | 70.5 | 49.7 | |
| TransNext-SmallEncoder size (M)=49.7, #Params. (M)=69.3, Framework=Mask R-CNN, Schedule=1x2023.11 | 45.5 | 69.8 | 49.1 | |
| TransNeXt-TinyEncoder size (M)=28.2, #Params. (M)=47.9, Framework=Mask R-CNN, Schedule=1x2023.11 | 44.6 | 68.6 | 48.1 | |
| InternImage-BEncoder size (M)=97, #Params. (M)=115, Framework=Mask R-CNN, Schedule=1x2023.11 | 44 | 67.8 | 47.4 | |
| SMT-BEncoder size (M)=32, #Params. (M)=51.7, Framework=Mask R-CNN, Schedule=1x2023.11 | 44 | 67.6 | 47.4 | |
| CSWin-BEncoder size (M)=78, #Params. (M)=97, Framework=Mask R-CNN, Schedule=1x2023.11 | 43.9 | 67.8 | 47.3 | |
| BiFormer-BEncoder size (M)=56.8, #Params. (M)=76.3, Framework=Mask R-CNN, Schedule=1x2023.11 | 43.7 | 67.6 | 47.1 | |
| FocalNet-B (LRF)Encoder size (M)=88.7, #Params. (M)=111.4, Framework=Mask R-CNN, Schedule=1x2023.11 | 43.5 | 67.9 | 46.7 | |
| InternImage-SEncoder size (M)=50, #Params. (M)=69, Framework=Mask R-CNN, Schedule=1x2023.11 | 43.3 | 67.1 | 46.7 | |
| BiFormer-SEncoder size (M)=25.5, #Params. (M)=45.2, Framework=Mask R-CNN, Schedule=1x2023.11 | 43.2 | 66.8 | 46.5 | |
| CSWin-SEncoder size (M)=35, #Params. (M)=54, Framework=Mask R-CNN, Schedule=1x2023.11 | 43.2 | 67.1 | 46.2 | |
| FocalNet-S (LRF)Encoder size (M)=50.3, #Params. (M)=72.3, Framework=Mask R-CNN, Schedule=1x2023.11 | 43.1 | 67.4 | 46.2 | |
| SMT-SEncoder size (M)=20.5, #Params. (M)=40, Framework=Mask R-CNN, Schedule=1x2023.11 | 43 | 66.6 | 46.1 | |
| PVTv2-B4Encoder size (M)=62.6, #Params. (M)=82.2, Framework=Mask R-CNN, Schedule=1x2023.11 | 42.7 | 66.1 | 46.1 | |
| RILSBackbone=ViT-B/16, Pre-training Dataset=L-20M, Pre-training Epochs=25, Fine-tuning Epochs=252023.01 | 42.6 | 66.8 | 45.8 | |
| PVTv2-B3Encoder size (M)=45.2, #Params. (M)=64.9, Framework=Mask R-CNN, Schedule=1x2023.11 | 42.5 | 65.7 | 45.7 | |
| InternImage-TEncoder size (M)=30, #Params. (M)=49, Framework=Mask R-CNN, Schedule=1x2023.11 | 42.5 | 66.1 | 45.8 | |
| PVTv2-B5Encoder size (M)=82, #Params. (M)=101.6, Framework=Mask R-CNN, Schedule=1x2023.11 | 42.5 | 65.7 | 46 | |
| MAEBackbone=ViT-B/16, Pre-training Dataset=L-20M, Pre-training Epochs=25, Fine-tuning Epochs=252023.01 | 42.4 | 65.8 | 46.4 | |
| MAE+CLIPBackbone=ViT-B/16, Pre-training Dataset=L-20M, Pre-training Epochs=25, Fine-tuning Epochs=252023.01 | 42.4 | 66.2 | 45.7 | |
| Swin-BEncoder size (M)=87.8, #Params. (M)=107.1, Framework=Mask R-CNN, Schedule=1x2023.11 | 42.3 | 66 | 45.5 | |
| CSWin-TEncoder size (M)=23, #Params. (M)=42, Framework=Mask R-CNN, Schedule=1x2023.11 | 42.2 | 65.6 | 45.4 | |
| Swin-SEncoder size (M)=49.6, #Params. (M)=69.1, Framework=Mask R-CNN, Schedule=1x2023.11 | 42.1 | 65.8 | 45.2 | |
| CLIPBackbone=ViT-B/16, Pre-training Dataset=L-20M, Pre-training Epochs=25, Fine-tuning Epochs=252023.01 | 42 | 65.9 | 45.1 | |
| FocalNet-T (LRF)Encoder size (M)=28.6, #Params. (M)=48.9, Framework=Mask R-CNN, Schedule=1x2023.11 | 41.5 | 65.1 | 44.5 | |
| SLIPBackbone=ViT-B/16, Pre-training Dataset=L-20M, Pre-training Epochs=25, Fine-tuning Epochs=252023.01 | 41.5 | 65.1 | 44.1 | |
| PVTv2-B2Encoder size (M)=25.4, #Params. (M)=45.3, Framework=Mask R-CNN, Schedule=1x2023.11 | 41.2 | 64.2 | 44.4 | |
| Swin-TEncoder size (M)=28.3, #Params. (M)=47.8, Framework=Mask R-CNN, Schedule=1x2023.11 | 39.1 | 61.6 | 42 |