Semantic Segmentation on VOC20 2012 (test)
32.3mIoU (Foreground)PAL
Evaluation Results
| Method | Links | |
|---|---|---|
| PALVisual Backbone=DINOv2 ViT-L, Text Encoder=RoBERTa-Large, Evaluation Protocol=Zero-shot2026.05 | 32.3 | |
| FA (20M)Training Data=20M high-concept-coverage curated image-text pairs, Visual Backbone=DINOv2 ViT-L, Text Encoder=RoBERTa-Large, Evaluation Protocol=Zero-shot2026.05 | 31.4 | |
| SAILVisual Backbone=DINOv2 ViT-L, Text Encoder=RoBERTa-Large, Evaluation Protocol=Zero-shot2026.05 | 22.3 | |
| FAVisual Backbone=DINOv2 ViT-L, Text Encoder=RoBERTa-Large, Evaluation Protocol=Zero-shot2026.05 | 20.1 | |
| MLPRSVisual Backbone=DINOv2 ViT-L, Text Encoder=RoBERTa-Large, Evaluation Protocol=Zero-shot2026.05 | 11.8 | |
| LinearRSVisual Backbone=DINOv2 ViT-L, Text Encoder=RoBERTa-Large, Evaluation Protocol=Zero-shot2026.05 | 10.8 |