Classification on ImageNet-9 Backgrounds Challenge
98.4Accuracy (Original IN-9)PDiscoFormer
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| PDiscoFormerCategory=Late Masking, Arch.=ViT-B, K=12025.06 | 98.4 | — | 93.9 | 88.6 | 5.3 | |
| DinoV2Category=Self-Supervised Pre-training, Arch.=ViT-L, Backbone Status=Frozen, Model capacity=Larger-capacity2025.06 | 98.3 | — | 95.5 | 90.2 | 5.3 | |
| DinoV2Category=Self-Supervised Pre-training, Arch.=ViT-B, Backbone Status=Frozen2025.06 | 98.1 | — | 93.1 | 87.1 | 6 | |
| ERMCategory=Supervised Training, Arch.=ViT-L, Model capacity=Larger-capacity2025.06 | 98 | — | 93 | 89.4 | 3.6 | |
| SWAG + LLECategory=Self-Sup. + De-biasing, Arch.=ViT-B2025.06 | 98 | — | 92.4 | 87.9 | 4.5 | |
| ERMCategory=Supervised Training, Arch.=ViT-B2025.06 | 97.9 | — | 92.4 | 87.9 | 4.6 | |
| iFAMCategory=Early Masking, Arch.=ViT-B, K=12025.06 | 97.5 | — | 93.5 | 91.1 | 2.4 | |
| MAE + LLECategory=Self-Sup. + De-biasing, Arch.=ViT-B2025.06 | 97.4 | — | 92.5 | 88.3 | 4.2 | |
| MAE + LLECategory=Self-Sup. + De-biasing, Arch.=ViT-L, Model capacity=Larger-capacity2025.06 | 97.4 | — | 93.5 | 89.8 | 3.6 | |
| ERMCategory=Supervised Training, Arch.=R-152, Model capacity=Larger-capacity2025.06 | 97.3 | — | 92.1 | 87.4 | 4.7 | |
| ERMCategory=Supervised Training, Arch.=R-502025.06 | 96.4 | — | 90 | 84.6 | 5.4 | |
| AENIBBackbone=ViT-B/162023.03 | 96.1 | 21.1 | 88.9 | 81.8 | 7.1 | |
| Baseline (Cross-Entropy)Backbone=ViT-B/162023.03 | 96 | 24.2 | 87.4 | 80.1 | 7.3 | |
| MaskTuneCategory=Specialized De-biasing, Arch.=R-502025.06 | 95.6 | — | 91.1 | 78.6 | 12.5 | |
| AENIBBackbone=ViT-S/162023.03 | 95.5 | 17.8 | 88.3 | 80.5 | 7.8 | |
| LLECategory=Specialized De-biasing, Arch.=R-502025.06 | 95.5 | — | 88.3 | 83.4 | 4.9 | |
| Baseline (Cross-Entropy)Backbone=ViT-S/162023.03 | 95.3 | 20.3 | 86.3 | 77.8 | 8.5 |