Street-view Image Attribute Classification on GSS Reflection
78.72AccuracyMaxViT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| MaxViTParadigm=Vision Transformer, Trainable Parameters=30.9M2026.02 | 78.72 | 75.67 | 79.56 | 57.61 | |
| CLIP-MHAdapterParadigm=Parameter-Efficient Adaptation, Trainable Parameters=1.38M2026.02 | 76.69 | 64.93 | 74.1 | 26.97 | |
| CLIP-Linear ProbeParadigm=Parameter-Efficient Adaptation, Trainable Parameters=3K2026.02 | 74.94 | 68.19 | 74.81 | 36.02 | |
| CoOpParadigm=Parameter-Efficient Adaptation, Trainable Parameters=8K2026.02 | 74.66 | 58.75 | 70.32 | 17.1 | |
| ZeroR-TrainerParadigm=Zero-shot Transfer2026.02 | 72.58 | 42.06 | 61.05 | 0 | |
| Zero-shot CLIPParadigm=Zero-shot Transfer2026.02 | 60.26 | 46.35 | 58.69 | -6.37 | |
| CLIP-AdapterParadigm=Parameter-Efficient Adaptation, Trainable Parameters=0.52M2026.02 | 58.75 | 45.9 | 57.81 | -7.7 |