Image Classification on RESISC
97.1AccuracyCLIP* L/14
Evaluation Results
| Method | Links | |
|---|---|---|
| CLIP* L/14MAP head=true, Grain=Coarse, Frozen representation=true, backbone=ViT-L/142023.06 | 97.1 | |
| CapPa L/14MAP head=true, Grain=Coarse, Frozen representation=true, backbone=ViT-L/142023.06 | 96.9 | |
| CLIP* (16k)MAP head=true, Grain=Coarse, Frozen representation=true2023.06 | 96.4 | |
| CapPaMAP head=true, Grain=Coarse, Frozen representation=true2023.06 | 96.1 | |
| Fine-TunedBackbone=DINOv3 ViT-B/162025.12 | 95.7 | |
| Linear ProbeBackbone=DINOv3 ViT-B/162025.12 | 92.7 | |
| CLIP* (8k)MAP head=true, Grain=Coarse, Frozen representation=true2023.06 | 92.5 | |
| Fine-TunedBackbone=CLIP ViT-B/32, Classes=452025.12 | 92.3 | |
| Linear ProbeBackbone=CLIP ViT-B/32, Classes=452025.12 | 91.7 | |
| Task MatrixBackbone=DINOv3 ViT-B/16, best layer=112025.12 | 91.4 | |
| CapMAP head=true, Grain=Coarse, Frozen representation=true2023.06 | 90.5 | |
| Task MatrixBackbone=CLIP ViT-B/32, Best Layer=11, Classes=452025.12 | 89.1 | |
| CLIP ViT-B/16Img. encoder=CLIP ViT-B/162026.05 | 57.14 | |
| CLIP ViT-B/32Img. encoder=CLIP ViT-B/322026.05 | 55.19 | |
| CLIP RN-101Img. encoder=CLIP RN-1012026.05 | 41.37 | |
| CLIP RN-50Img. encoder=CLIP RN-502026.05 | 41.25 | |
| TinyViT-21M + CLIPImg. encoder=TinyViT-21M, Txt. encoder=CLIP2026.05 | 28.33 | |
| ConvNext-B + CLIPImg. encoder=ConvNext-B, Txt. encoder=CLIP2026.05 | 27.29 | |
| ConvNext-B + MPNetImg. encoder=ConvNext-B, Txt. encoder=MPNet2026.05 | 24.65 | |
| TinyViT-21M + MPNetImg. encoder=TinyViT-21M, Txt. encoder=MPNet2026.05 | 24.59 | |
| BEiT-B/16 + CLIPImg. encoder=BEiT-B/16, Txt. encoder=CLIP2026.05 | 24.21 | |
| ConvNext-B + RoBERTaImg. encoder=ConvNext-B, Txt. encoder=RoBERTa2026.05 | 22.79 | |
| TinyViT-21M + RoBERTaImg. encoder=TinyViT-21M, Txt. encoder=RoBERTa2026.05 | 22.75 | |
| ConvNext-B + MiniLMImg. encoder=ConvNext-B, Txt. encoder=MiniLM2026.05 | 21.73 | |
| BEiT-B/16 + MPNetImg. encoder=BEiT-B/16, Txt. encoder=MPNet2026.05 | 20.95 | |
| ConvFormer-S18 + CLIPImg. encoder=ConvFormer-S18, Txt. encoder=CLIP2026.05 | 19.71 | |
| TinyViT-21M + MiniLMImg. encoder=TinyViT-21M, Txt. encoder=MiniLM2026.05 | 18.68 | |
| BEiT-B/16 + RoBERTaImg. encoder=BEiT-B/16, Txt. encoder=RoBERTa2026.05 | 18.54 | |
| CAFormer-S18 + MPNetImg. encoder=CAFormer-S18, Txt. encoder=MPNet2026.05 | 18.52 | |
| ConvFormer-S18 + MPNetImg. encoder=ConvFormer-S18, Txt. encoder=MPNet2026.05 | 18.52 | |
| ConvFormer-S18 + RoBERTaImg. encoder=ConvFormer-S18, Txt. encoder=RoBERTa2026.05 | 17.33 | |
| CAFormer-S18 + CLIPImg. encoder=CAFormer-S18, Txt. encoder=CLIP2026.05 | 16.89 | |
| CAFormer-S18 + RoBERTaImg. encoder=CAFormer-S18, Txt. encoder=RoBERTa2026.05 | 16.11 | |
| BEiT-B/16 + MiniLMImg. encoder=BEiT-B/16, Txt. encoder=MiniLM2026.05 | 14.35 | |
| ConvFormer-S18 + MiniLMImg. encoder=ConvFormer-S18, Txt. encoder=MiniLM2026.05 | 12.73 | |
| CAFormer-S18 + MiniLMImg. encoder=CAFormer-S18, Txt. encoder=MiniLM2026.05 | 11.27 |