Scene Recognition on SUN397
83.4AccuracyGLA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GLABackbone=ViT-B/16, Evaluation Protocol=Logit Adjustment2023.10 | 83.4 | — | |
| WiSE-FTBackbone=ViT-B/16, Evaluation Protocol=Weight Ensembling2023.10 | 82.9 | — | |
| E2EBackbone=ViT-B/16, Evaluation Protocol=End-to-end fine-tuning2023.10 | 82.4 | — | |
| VT-FSLLearning Paradigm=Training-based2026.03 | 81.98 | — | |
| GLABackbone=ViT-B/32, Evaluation Protocol=Logit Adjustment2023.10 | 81.2 | — | |
| WiSE-FTBackbone=ViT-B/32, Evaluation Protocol=Weight Ensembling2023.10 | 80.8 | — | |
| SARELearning Paradigm=Training-based2026.03 | 80.05 | — | |
| E2EBackbone=ViT-B/32, Evaluation Protocol=End-to-end fine-tuning2023.10 | 80 | — | |
| LPBackbone=ViT-B/16, Evaluation Protocol=Linear Probe2023.10 | 78 | — | |
| UniFGVCLearning Paradigm=Training-free, Method Strategy=Reasoning-based2026.03 | 76.6 | — | |
| LPBackbone=ViT-B/32, Evaluation Protocol=Linear Probe2023.10 | 75.6 | — | |
| SCANLearning Paradigm=Training-free, Method Strategy=Retrieval-based2026.03 | 72.83 | — | |
| AutoSEPLearning Paradigm=Training-free, Method Strategy=Reasoning-based2026.03 | 71.92 | — | |
| ProtoMMLearning Paradigm=Training-free, Method Strategy=Retrieval-based2026.03 | 70.67 | — | |
| AWTLearning Paradigm=Training-free, Method Strategy=Retrieval-based2026.03 | 70.33 | — | |
| CascadeVLMLearning Paradigm=Training-free, Method Strategy=Reasoning-based2026.03 | 69.96 | — | |
| FineDeficsLearning Paradigm=Training-based2026.03 | 68.9 | — | |
| SuS-X-LCLearning Paradigm=Training-free, Method Strategy=Retrieval-based2026.03 | 68.02 | — | |
| RARLearning Paradigm=Training-free, Method Strategy=Retrieval-based2026.03 | 67.09 | — | |
| E-FineRLearning Paradigm=Training-free, Method Strategy=Retrieval-based2026.03 | 66.96 | — | |
| FineRLearning Paradigm=Training-free, Method Strategy=Retrieval-based2026.03 | 65.72 | — | |
| CLIPMode=Zero-shot2024.04 | 65.2 | — | |
| Zero-shotBackbone=ViT-B/16, Evaluation Protocol=Zero-shot2023.10 | 64.8 | — | |
| ARFFinetuning Dataset=ImageNet2024.04 | 63.8 | — | |
| BLM+Backbone=CLIP (ViT-B32)2024.10 | 63.8 | — | |
| BLMBackbone=CLIP (ViT-B32)2024.10 | 63.1 | — | |
| BADGE + PCBBackbone=ViT-B/32, Pre-trained Model=CLIP, Training Setting=16 samples per class2023.11 | 62.8 | — | |
| CLIP-B/32Learning Paradigm=Backbone2026.03 | 62.32 | — | |
| Zero-shotBackbone=ViT-B/32, Evaluation Protocol=Zero-shot2023.10 | 62.2 | — | |
| BADGEBackbone=ViT-B/32, Pre-trained Model=CLIP, Training Setting=16 samples per class2023.11 | 61.84 | — | |
| NoneBackbone=CLIP (ViT-B32), Mapping=None2024.10 | 61.4 | — | |
| Entropy + PCBBackbone=ViT-B/32, Pre-trained Model=CLIP, Training Setting=16 samples per class2023.11 | 61.14 | — | |
| RandomBackbone=ViT-B/32, Pre-trained Model=CLIP, Training Setting=16 samples per class2023.11 | 60.73 | — | |
| One-to-one MappingBackbone=CLIP (ViT-B32), Mapping=One-to-one Mapping2024.10 | 60.6 | — | |
| EntropyBackbone=ViT-B/32, Pre-trained Model=CLIP, Training Setting=16 samples per class2023.11 | 60.57 | — | |
| Coreset + PCBBackbone=ViT-B/32, Pre-trained Model=CLIP, Training Setting=16 samples per class2023.11 | 58.21 | — | |
| Qwen2.5-VL-7BLearning Paradigm=Backbone2026.03 | 58.11 | — | |
| CoresetBackbone=ViT-B/32, Pre-trained Model=CLIP, Training Setting=16 samples per class2023.11 | 55.68 | — | |
| FLYPFinetuning Dataset=ImageNet2024.04 | 52 | — | |
| LP-FTFinetuning Dataset=ImageNet2024.04 | 49.9 | — | |
| FTFinetuning Dataset=ImageNet2024.04 | 39.3 | — | |
| MMRLmode=Target Evaluation2025.05 | 26.3 | — | |
| MMRL++mode=Target Evaluation2025.05 | 26.07 | — | |
| MMAmode=Target Evaluation2025.05 | 25.33 | — | |
| MaPLemode=Target Evaluation2025.05 | 24.74 | — | |
| PromptSRCmode=Target Evaluation2025.05 | 23.9 | — | |
| TCPmode=Target Evaluation2025.05 | 23.45 | — | |
| CoOpOpmode=Target Evaluation2025.05 | 22.94 | — | |
| CoOpmode=Target Evaluation2025.05 | 18.47 | — | |
| C-RADIOv3-BEvaluation protocol=frozen-backbone linear probing, Crop size=256 x 2562026.05 | — | 76.91 | |
| CLIP-B/16Evaluation protocol=frozen-backbone linear probing, Crop size=224 x 2242026.05 | — | 78.05 | |
| DFN2B-CLIP-B/16Evaluation protocol=frozen-backbone linear probing, Crop size=224 x 2242026.05 | — | 78.68 | |
| DINOv2-BEvaluation protocol=frozen-backbone linear probing, Crop size=224 x 2242026.05 | — | 75.67 | |
| DINOv2-Reg-BEvaluation protocol=frozen-backbone linear probing, Crop size=224 x 2242026.05 | — | 76.85 | |
| DINOv3-BEvaluation protocol=frozen-backbone linear probing, Crop size=256 x 2562026.05 | — | 77.59 | |
| OpenCLIP-B/16Evaluation protocol=frozen-backbone linear probing, Crop size=224 x 2242026.05 | — | 78.83 | |
| SigLIP2-B/16-256Evaluation protocol=frozen-backbone linear probing, Crop size=256 x 2562026.05 | — | 78.92 | |
| VECA-BEvaluation protocol=frozen-backbone linear probing, Crop size=256 x 256, Core budget (C)=642026.05 | — | 76.6 | |
| VECA-BEvaluation protocol=frozen-backbone linear probing, Crop size=256 x 256, Core budget (C)=82026.05 | — | 75.35 |