Semantic Segmentation on VOC (val)
94.4mIoUOTSeg+
Evaluation Results
| Method | Links | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| OTSeg+Category=Zero-shot segmentation (ZS3), Source=COCO-1562024.03 | 94.4 | — | — | — | — | — | — | — | — | — | — | — | |
| OTSegCategory=Zero-shot segmentation (ZS3), Source=COCO-1562024.03 | 94.2 | — | — | — | — | — | — | — | — | — | — | — | |
| SANCategory=Open-vocabulary segmentation (OVS), Source=COCO-1712024.03 | 94.1 | — | — | — | — | — | — | — | — | — | — | — | |
| FreeSegCategory=Open-vocabulary segmentation (OVS), Source=COCO-1712024.03 | 85.6 | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2FormerBackbone=Swin-B, Training set=OVAM (S: 13.5K) + VOC (R: 11.5K)2024.03 | 83.8 | 94.7 | 78.2 | 81.4 | 93.9 | 91.3 | 94.2 | 41.7 | 94.2 | 88.2 | 90.6 | 79.7 | |
| Mask2FormerBackbone=Swin-B, Training set=OVAM (S: 13.5K) + VOC (R: 5K)2024.03 | 82.9 | 91.7 | 79.7 | 79.1 | 95.3 | 89.6 | 93.5 | 44.9 | 91.8 | 89 | 90.6 | 82.6 | |
| Mask2FormerBackbone=Swin-B, Training set=VOC (R: 11.5K)2024.03 | 82.8 | 94.9 | 82 | 81.2 | 91.5 | 90.3 | 95.4 | 42.1 | 85.4 | 89.4 | 90.3 | 86.7 | |
| DeepLabV3Segmenter=DeepLabV3, Backbone=ResNet101, Training set=VOC's training (11.5k images)2023.09 | 79.9 | — | — | — | — | — | — | — | — | — | — | — | |
| DeepLabV3Segmenter=DeepLabV3, Backbone=ResNet50, Training set=VOC's training (11.5k images)2023.09 | 77.4 | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2FormerSegmenter=Mask2Former, Backbone=ResNet50, Training set=VOC's training (11.5k images)2023.09 | 77.3 | — | — | — | — | — | — | — | — | — | — | — | |
| DeCon-ML-LPret. Dataset=COCO, Pret. Dec.=FPN, Backbone=ConvNeXt-S, Pre-train Epochs=800, alpha=0, dropout=0.52025.03 | 73.81 | — | — | — | — | — | — | — | — | — | — | — | |
| SlotConPret. Dataset=COCO, Pret. Dec.=None, Backbone=ConvNeXt-S, Pre-train Epochs=8002025.03 | 73.24 | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2FormerBackbone=ResNet50, Training set=OVAM (S: 13.5K) + VOC (R: 11.5K)2024.03 | 70.5 | 89.7 | 63 | 60.6 | 84.9 | 83.4 | 91 | 28.5 | 69.9 | 74.2 | 86.5 | 62.8 | |
| Mask2FormerBackbone=ResNet50, Training set=OVAM (S: 13.5K) + VOC (R: 5K)2024.03 | 69.8 | 85.4 | 53.5 | 65.6 | 87.7 | 82.6 | 82.6 | 26.9 | 66.6 | 70.1 | 86.9 | 67 | |
| Mask2FormerBackbone=ResNet50, Training set=VOC (R: 11.5K)2024.03 | 69.7 | 88.9 | 53 | 62.9 | 83 | 83 | 90.9 | 27.2 | 71.8 | 73.2 | 86.2 | 59.6 | |
| Dataset DiffusionSegmenter=DeepLabV3, Backbone=ResNet101, Training set=Dataset Diffusion (40k images)2023.09 | 64.8 | — | — | — | — | — | — | — | — | — | — | — | |
| Dataset DiffusionSegmenter=DeepLabV3, Backbone=ResNet50, Training set=Dataset Diffusion (40k images)2023.09 | 61.6 | — | — | — | — | — | — | — | — | — | — | — | |
| Dataset DiffusionSegmenter=Mask2Former, Backbone=ResNet50, Training set=Dataset Diffusion (40k images)2023.09 | 60.2 | — | — | — | — | — | — | — | — | — | — | — | |
| UpernetBackbone=ResNet50, Training set=OVAM (S: 13.5K) + VOC (R: 11.5K)2024.03 | 58.1 | 80.8 | 47.1 | 51.8 | 52.3 | 72.5 | 71.1 | 74.5 | 21.3 | 57.3 | 73 | 39.8 | |
| Mask2FormerSegmenter=Mask2Former, Backbone=ResNet50, Training set=DiffuMask [8] (60k images)2023.09 | 57.4 | — | — | — | — | — | — | — | — | — | — | — | |
| UpernetBackbone=ResNet50, Training set=OVAM (S: 13.5K) + VOC (R: 5K)2024.03 | 54.4 | 72.2 | 22.9 | 29.1 | 79.9 | 75.4 | 76.8 | 23.3 | 58.8 | 66.2 | 72.4 | 25.3 | |
| Mask2FormerBackbone=Swin-B, Training set=OVAM (S: 13.5K)2024.03 | 53.5 | 66.1 | 27.9 | 57.3 | 70.8 | 51.7 | 81.1 | 15 | 78.9 | 68.9 | 46.4 | 0 | |
| UpernetBackbone=ResNet50, Training set=VOC (R: 11.5K)2024.03 | 51.3 | 75.9 | 31.3 | 33.5 | 83.6 | 76.9 | 77.6 | 23.3 | 49.6 | 66.8 | 73.1 | 25.9 | |
| UpernetBackbone=ResNet50, Training set=OVAM (S: 13.5K)2024.03 | 42.1 | 45.2 | 29.5 | 19.7 | 68.6 | 46.5 | 60.5 | 12.2 | 55.2 | 45 | 50.2 | 26.2 | |
| Mask2FormerBackbone=ResNet50, Training set=OVAM (S: 13.5K)2024.03 | 41.5 | 54.9 | 30.1 | 40.3 | 70.8 | 47.2 | 65 | 3.1 | 51.1 | 46.8 | 39.9 | 0 |