Texture Classification on Describable Textures Dataset (DTD)
84AccuracyRADAM
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| RADAMBackbone=ConvNeXt-L, Input size=224x224, Pre-training dataset=ImageNet-21K2023.03 | 84 | — | — | |
| HPTBackbone=ViT-B/162023.12 | 83.84 | 72.16 | 63.33 | |
| RADAMBackbone=ConvNeXt-XL, Input size=224x224, Pre-training dataset=ImageNet-21K2023.03 | 83.7 | — | — | |
| PromptSRCShots=162024.04 | 83.37 | 71.75 | 62.97 | |
| ProMetaRShots=162024.04 | 83.02 | 72.31 | 64.05 | |
| CLIPBackbone=ViT L/14, Input size=336x336, Pre-training dataset=WIT 400m, Evaluation protocol=zero-shot2023.03 | 83 | — | — | |
| RADAMBackbone=ConvNeXt-B, Input size=224x224, Pre-training dataset=ImageNet-21K2023.03 | 82.8 | — | — | |
| μ2Net+Backbone=ViT-L/16, Input size=384x384, Pre-training dataset=ImageNet-21K2023.03 | 82.2 | — | — | |
| RADAMBackbone=ConvNeXt-T, Input size=224x224, Pre-training dataset=ImageNet-21K2023.03 | 81.4 | — | — | |
| ViT B/16Backbone=ViT B/16, Pre-training dataset=Bamboo 69m, Evaluation protocol=fine-tuning2023.03 | 81.2 | — | — | |
| IVLPShots=162024.04 | 80.67 | 65.63 | 55.31 | |
| MaPLeBackbone=ViT-B/162023.12 | 80.36 | 68.16 | 59.18 | |
| MaPLeShots=162024.04 | 80.36 | 68.16 | 59.18 | |
| CoOpBackbone=ViT-B/16, Prompt Type=Static learned, Number of Shots=16, Context Length=4, Initialization=a photo of a2022.03 | 79.44 | 54.24 | — | |
| CoOpShots=162024.04 | 79.44 | 54.24 | 41.18 | |
| Multilayer-FVBackbone=EfficientNet-B5, Input size=512x5122023.03 | 78.9 | — | — | |
| DSRNetBackbone=ResNet50, Input size=224x2242023.03 | 77.6 | — | — | |
| EfficientNet-B5training_mode=fine-tuning2026.05 | 77.6 | — | — | |
| DSRNet2026.05 | 77.6 | — | — | |
| RADAMBackbone=ConvNeXt-L, Input size=224x2242023.03 | 77.4 | — | — | |
| SOT-GLPShots=16, Backbone=ViT-B/16, Pre-training=CLIP2026.03 | 77.1 | — | — | |
| CoCoOpBackbone=ViT-B/16, Prompt Type=Dynamic learned (Conditional), Number of Shots=16, Context Length=4, Initialization=a photo of a2022.03 | 77.01 | 64.85 | — | |
| CoCoOpBackbone=ViT-B/162023.12 | 77.01 | 64.85 | 56 | |
| CoCoOpShots=162024.04 | 77.01 | 64.85 | 56 | |
| RADAMBackbone=ConvNeXt-T, Input size=224x2242023.03 | 77 | — | — | |
| RADAM2026.05 | 77 | — | — | |
| RPOShots=162024.04 | 76.7 | 68.61 | 62.13 | |
| Residual Pooling2026.05 | 76.6 | — | — | |
| RADAMBackbone=ConvNeXt-B, Input size=224x2242023.03 | 76.4 | — | — | |
| MAPNetBackbone=ResNet50, Input size=224x2242023.03 | 76.1 | — | — | |
| DFAENBackbone=Densenet161, Input size=224x2242023.03 | 76.1 | — | — | |
| DFAEN2026.05 | 76.1 | — | — | |
| RADAMBackbone=ResNet50, Input size=224x2242023.03 | 75.6 | — | — | |
| GalLoPShots=16, Backbone=ViT-B/16, Pre-training=CLIP2026.03 | 75.5 | — | — | |
| SIFT-FV2026.05 | 75.5 | — | — | |
| Xception + SIFT-FV2026.05 | 75.4 | — | — | |
| RADAMBackbone=ConvNeXt-nano, Input size=224x2242023.03 | 74.9 | — | — | |
| iSQRT-COV-NetBackbone Model=ResNet-502019.04 | 74.8 | — | — | |
| FENet2026.05 | 74.2 | — | — | |
| iSQRT-COV-NetBackbone Model=VGG-VD162019.04 | 74 | — | — | |
| CLASSNetBackbone=ResNet50, Input size=224x2242023.03 | 74 | — | — | |
| CLASSNet2026.05 | 74 | — | — | |
| LFV2026.05 | 73.8 | — | — | |
| UNIGRAMShots=162024.04 | 73.62 | 67.56 | 62.38 | |
| DFAENBackbone=ResNet50, Input size=224x2242023.03 | 73.2 | — | — | |
| RADAM lightBackbone=MobileNet V2 1.4, Input size=224x2242023.03 | 73.1 | — | — | |
| B-CNNBackbone Model=VGG-VD162019.04 | 72.9 | — | — | |
| FASONBackbone Model=VGG-VD162019.04 | 72.9 | — | — | |
| PromptSRCShots=16, Backbone=ViT-B/16, Pre-training=CLIP2026.03 | 72.7 | — | — | |
| SMSOBackbone Model=ResNet-502019.04 | 72.51 | — | — | |
| FV-VGGVD2026.05 | 72.3 | — | — | |
| CLASSNetBackbone=ResNet18, Input size=224x2242023.03 | 71.5 | — | — | |
| PLOTShots=16, Backbone=ViT-B/16, Pre-training=CLIP2026.03 | 71.4 | — | — | |
| MaPLeShots=16, Backbone=ViT-B/16, Pre-training=CLIP2026.03 | 71.3 | — | — | |
| DSRNetBackbone=ResNet18, Input size=224x2242023.03 | 71.2 | — | — | |
| Capsule2026.05 | 71 | — | — | |
| ProDAShots=16, Backbone=ViT-B/16, Pre-training=CLIP2026.03 | 70.9 | — | — | |
| Linear ProbeShots=16, Backbone=ViT-B/16, Pre-training=CLIP2026.03 | 70 | — | — | |
| CoOpShots=16, Backbone=ViT-B/16, Pre-training=CLIP2026.03 | 69.9 | — | — | |
| DeepTENBackbone=ResNet50, Input size=352x3522023.03 | 69.6 | — | — | |
| MAPNetBackbone=ResNet18, Input size=224x2242023.03 | 69.5 | — | — | |
| LoCoOpShots=16, Backbone=ViT-B/16, Pre-training=CLIP2026.03 | 69.5 | — | — | |
| RADAM lightBackbone=MobileNet V2, Input size=224x2242023.03 | 69.3 | — | — | |
| SMSOBackbone Model=VGG-VD162019.04 | 69.26 | — | — | |
| MMAmode=Target Evaluation2025.05 | 68.17 | — | — | |
| RADAMBackbone=ResNet18, Input size=224x2242023.03 | 68.1 | — | — | |
| MMRL++mode=Target Evaluation2025.05 | 67.77 | — | — | |
| MMRLmode=Target Evaluation2025.05 | 67.57 | — | — | |
| CoOpOpmode=Target Evaluation2025.05 | 67.36 | — | — | |
| TCPmode=Target Evaluation2025.05 | 67.15 | — | — | |
| PromptSRCmode=Target Evaluation2025.05 | 67.1 | — | — | |
| MaPLemode=Target Evaluation2025.05 | 67.01 | — | — | |
| CoOpmode=Target Evaluation2025.05 | 64.15 | — | — | |
| CoCoOpShots=16, Backbone=ViT-B/16, Pre-training=CLIP2026.03 | 63 | — | — | |
| VGG-VD16Backbone Model=VGG-VD162019.04 | 62.9 | — | — | |
| BLM+Backbone=CLIP (ViT-B32)2024.10 | 61.5 | — | — | |
| NoneBackbone=CLIP (ViT-B32), Mapping=None2024.10 | 61.4 | — | — | |
| BLMBackbone=CLIP (ViT-B32)2024.10 | 60.9 | — | — | |
| One-to-one MappingBackbone=CLIP (ViT-B32), Mapping=One-to-one Mapping2024.10 | 59.5 | — | — | |
| CLIPBackbone=ViT-B/16, Prompt Type=Manual, Protocol=Zero-shot2022.03 | 53.24 | 56.37 | — | |
| CLIPBackbone=ViT-B/162023.12 | 53.24 | 56.37 | 59.9 | |
| CLIPShots=Zero-shot2024.04 | 53.24 | 56.37 | 59.9 | |
| CLIPMode=Zero-shot2024.04 | 46 | — | — | |
| CLIPShots=16, Backbone=ViT-B/16, Pre-training=CLIP2026.03 | 44.1 | — | — | |
| GIF-SDBackbone=ResNet-50, Expansion Ratio=20x2022.11 | 43.4 | — | — | |
| CLIPBackbone=CLIP, Expansion Ratio=1x2022.11 | 41.7 | — | — | |
| ARFFinetuning Dataset=ImageNet2024.04 | 40.4 | — | — | |
| UP-DP (gc(.))Backbone=ViT-H/14, Evaluation Protocol=Linear probe2023.07 | 40.3 | — | — | |
| UP-DP (gc(.))Backbone=ViT-G/14, Evaluation Protocol=Linear probe2023.07 | 40.2 | — | — | |
| GIF-DALLEBackbone=ResNet-50, Expansion Ratio=20x2022.11 | 39.5 | — | — | |
| UP-DP (g1(.))Backbone=ViT-H/14, Evaluation Protocol=Linear probe2023.07 | 39.4 | — | — | |
| UP-DP (f(.))Backbone=ViT-H/14, Evaluation Protocol=Linear probe2023.07 | 39.2 | — | — | |
| UP-DP (f(.))Backbone=ViT-G/14, Evaluation Protocol=Linear probe2023.07 | 38.9 | — | — | |
| UP-DP (g1(.))Backbone=ViT-G/14, Evaluation Protocol=Linear probe2023.07 | 38.8 | — | — | |
| UP-DP (gc(.))Backbone=ViT-B/32, Evaluation Protocol=Linear probe2023.07 | 38.5 | — | — | |
| UP-DP (g1(.))Backbone=ViT-B/32, Evaluation Protocol=Linear probe2023.07 | 37.9 | — | — | |
| LP-FTFinetuning Dataset=ImageNet2024.04 | 37.9 | — | — | |
| UP-DP (f(.))Backbone=ViT-B/32, Evaluation Protocol=Linear probe2023.07 | 37.2 | — | — | |
| FLYPFinetuning Dataset=ImageNet2024.04 | 36.9 | — | — | |
| DALL-E2Backbone=ResNet-50, Expansion Ratio=20x2022.11 | 34.5 | — | — |