Image Classification on Aircraft (Top-1 Accuracy)
57.4Top-1 AccOurs
Evaluation Results
| Method | Links | |
|---|---|---|
| OursShots=16, Backbone=ViT-B/16, Seeds=32025.12 | 57.4 | |
| IsoCLIPIntra-modal=✓, Classifier=NCM, Backbone=ViT-B/16-open2026.03 | 54.5 | |
| Image-ImageIntra-modal=✓, Classifier=NCM, Backbone=ViT-B/16-open2026.03 | 54 | |
| OSTBProtocol=Final Ensemble2026.06 | 52.24 | |
| OursShots=8, Backbone=ViT-B/16, Seeds=32025.12 | 49.7 | |
| DST (FixMatch)Pre-training=Unsupervised, Backbone=ResNet-50, Labels per category=42022.02 | 47.7 | |
| DST (FlexMatch)Pre-training=Unsupervised, Backbone=ResNet-50, Labels per category=42022.02 | 47.3 | |
| DST (FlexMatch)Pre-training=Supervised, Backbone=ResNet-50, Labels per category=42022.02 | 44.5 | |
| DST (FixMatch)Pre-training=Supervised, Backbone=ResNet-50, Labels per category=42022.02 | 43.2 | |
| CARPEp=400, k=20, Evaluation Protocol=k-NN, Multi-crop=false2023.10 | 42.1 | |
| LlipData Size=2.5B, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 41.5 | |
| OursShots=4, Backbone=ViT-B/16, Seeds=32025.12 | 40.2 | |
| MoCo-v3Ep=1000, k=20, Evaluation Protocol=k-NN, Multi-crop=false2023.10 | 36.9 | |
| DINOEp=800, k=20, Evaluation Protocol=k-NN, Multi-crop=true2023.10 | 35.3 | |
| OursShots=2, Backbone=ViT-B/16, Seeds=32025.12 | 34.9 | |
| CARPEp=400, k=20, Evaluation Protocol=k-NN, Multi-crop=true2023.10 | 34.8 | |
| TripletEp=980, k=20, Evaluation Protocol=k-NN, Multi-crop=false2023.10 | 33.4 | |
| Barlow TwinsEp=1000, k=20, Evaluation Protocol=k-NN, Multi-crop=false2023.10 | 32.7 | |
| OursShots=1, Backbone=ViT-B/16, Seeds=32025.12 | 32.2 | |
| DeepCluster-v2Ep=800, k=20, Evaluation Protocol=k-NN, Multi-crop=true2023.10 | 32 | |
| MetaCLIPData Size=2.5B, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 30.3 | |
| Image-TextIntra-modal=✗, Classifier=Zero-Shot, Backbone=ViT-B/16-open2026.03 | 29.8 | |
| SwAVEp=800, k=20, Evaluation Protocol=k-NN, Multi-crop=true2023.10 | 29 | |
| BaselinePre-training=Unsupervised, Backbone=ResNet-50, Labels per category=42022.02 | 28.7 | |
| OpenCLIPData Size=2B, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 25.8 | |
| BaselinePre-training=Supervised, Backbone=ResNet-50, Labels per category=42022.02 | 25.4 | |
| CLIP-ViT-B/16Layers=-2026.03 | 24.33 | |
| TCA (Baseline)Layers=3, 6, 9, KeepRate=0.72026.03 | 23.82 | |
| Col-LnLayers=3, 6, 9, KeepRate=0.72026.03 | 22.98 | |
| Col-LnLayers=0, 3, 6, KeepRate=0.72026.03 | 22.17 | |
| TCA (Baseline)Layers=0, 3, 6, KeepRate=0.72026.03 | 22.05 | |
| SeLa-v2Ep=400, k=20, Evaluation Protocol=k-NN, Multi-crop=true2023.10 | 20.7 | |
| CLIP-B/32Backbone=CLIP-B/32, Protocol=Zero-shot2026.06 | 19.17 | |
| InfoMinEp=800, k=20, Evaluation Protocol=k-NN, Multi-crop=false2023.10 | 18.2 | |
| oBoWEp=200, k=20, Evaluation Protocol=k-NN, Multi-crop=true2023.10 | 18.1 | |
| DreamLIPData Size=30M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 7.9 | |
| FLAIRData Size=30M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 7.2 | |
| CLIPData Size=30M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 5.7 | |
| SigLIPData Size=30M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 5.7 | |
| HyCoCLIPw/ boxes=true2025.10 | 3.57 | |
| MERUw/ boxes=false2025.10 | 3.53 | |
| MERUw/ boxes=true2025.10 | 3.53 | |
| PHyCLIPw/ boxes=true2025.10 | 3.24 | |
| CLIP-PGSImage Encoder=ViT-B/16, p=0.3, Protocol=Zero-shot2025.03 | 3.1 | |
| CLIPw/ boxes=false2025.10 | 3.01 | |
| CLIPw/ boxes=true2025.10 | 2.89 | |
| CLIP-PGSImage Encoder=ViT-S/16, p=0.3, Protocol=Zero-shot2025.03 | 2.7 | |
| E-CLIPImage Encoder=ViT-B/16, Protocol=Zero-shot2025.03 | 2.2 | |
| CLIP-PGSImage Encoder=ViT-S/16, p=0.5, Protocol=Zero-shot2025.03 | 2 | |
| CLIP-PGSImage Encoder=ViT-B/16, p=0.5, Protocol=Zero-shot2025.03 | 1.9 | |
| FLAIRData Size=3M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 1.7 | |
| CLIPImage Encoder=ViT-B/16, Protocol=Zero-shot2025.03 | 1.7 | |
| LaCLIPData Size=3M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 1.6 | |
| DreamLIPData Size=3M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 1.6 | |
| MLLM-AData Size=3M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 1.5 | |
| SigLIPData Size=3M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 1.4 | |
| FLIPImage Encoder=ViT-B/16, Protocol=Zero-shot2025.03 | 1.4 | |
| A-CLIPImage Encoder=ViT-B/16, Protocol=Zero-shot2025.03 | 1.3 | |
| CLIPData Size=3M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 1 |