Image Classification on UCF101 (Accuracy)
84.9AccuracyTOGA
Evaluation Results
| Method | Links | |
|---|---|---|
| TOGAShots=16, Venue=-2026.03 | 84.9 | |
| CLIP-AdapterBackbone=ViT-B/16, Shots=16, Blending ratio (alpha)=best2026.03 | 84 | |
| TOGAShots=8, Venue=-2026.03 | 83.9 | |
| HOSO-AdapterBackbone=ViT-B/16, Shots=16, Number of runs=32026.03 | 83.43 | |
| CLIP-1+DINO(v2+v3)Setting=Inductive, Test-Time Adaptation (TTA)=false2025.06 | 81.7 | |
| TOGAShots=4, Venue=-2026.03 | 81.7 | |
| IsoCLIPIntra-modal=✓, Classifier=NCM, Backbone=ViT-B/16-open2026.03 | 80.9 | |
| CLIP-AdapterBackbone=ViT-B/16, Shots=16, Blending ratio (alpha)=0.22026.03 | 80.4 | |
| CLIP-1+DINOv3Setting=Inductive, Test-Time Adaptation (TTA)=false2025.06 | 80.3 | |
| Image-ImageIntra-modal=✓, Classifier=NCM, Backbone=ViT-B/16-open2026.03 | 79.9 | |
| CLIP-1+DINOv2Setting=Inductive, Test-Time Adaptation (TTA)=false2025.06 | 79.1 | |
| TOGAShots=2, Venue=-2026.03 | 77.9 | |
| Align+MixShot=16, Backbone=ResNet-502026.03 | 77.9 | |
| GDAShot=16, Backbone=ResNet-502026.03 | 76.9 | |
| COSMIC*Setting=Inductive, Test-Time Adaptation (TTA)=true2025.06 | 76.2 | |
| CLIP-MoE + MoE-GRPOTraining shots=16-shot, Source dataset=ImageNet, Training epochs=32026.03 | 76.2 | |
| CLIP-1+CLIP-2Setting=Inductive, Test-Time Adaptation (TTA)=false2025.06 | 75.8 | |
| TOGAShots=1, Venue=-2026.03 | 74.5 | |
| CLIP-MoE + Det-FTTraining shots=16-shot, Source dataset=ImageNet, Training epochs=32026.03 | 73.9 | |
| CLIP-MoETraining shots=16-shot, Source dataset=ImageNet, Training epochs=32026.03 | 73 | |
| DMN*Setting=Inductive, Test-Time Adaptation (TTA)=true2025.06 | 72.5 | |
| OursTest-time prompt tuning=True2026.04 | 72.24 | |
| MaPLe + OursTest-time prompt tuning=True2026.04 | 72.21 | |
| TIP-XShot=16, Backbone=ResNet-502026.03 | 72 | |
| Align+MixShot=4, Backbone=ResNet-502026.03 | 71.5 | |
| TIPPLE*Setting=Inductive, Test-Time Adaptation (TTA)=true2025.06 | 71.2 | |
| GDAShot=4, Backbone=ResNet-502026.03 | 71 | |
| TDA*Setting=Inductive, Test-Time Adaptation (TTA)=true2025.06 | 70.7 | |
| TCP + SAMPLeOptimizer=SAMPLe2026.07 | 70.61 | |
| TIP-AdapterShot=16, Backbone=ResNet-502026.03 | 70.6 | |
| DPE*Setting=Inductive, Test-Time Adaptation (TTA)=true2025.06 | 70.4 | |
| CLIP-SVD2025.09 | 69.91 | |
| CoPromptOptimizer=Baseline2026.07 | 69.73 | |
| CoPrompt + SAMPLeOptimizer=SAMPLe2026.07 | 69.71 | |
| MaPLe + SAMPLeOptimizer=SAMPLe2026.07 | 69.58 | |
| ZeroSetting=Inductive, Test-Time Adaptation (TTA)=false2025.06 | 69.2 | |
| CoCoOp + SAMPLeOptimizer=SAMPLe2026.07 | 69 | |
| TCPOptimizer=Baseline2026.07 | 68.73 | |
| MTA*Setting=Inductive, Test-Time Adaptation (TTA)=true2025.06 | 68.7 | |
| MaPLeTraining shots=16-shot, Source dataset=ImageNet, Training epochs=32026.03 | 68.7 | |
| MaPLe2025.09 | 68.69 | |
| MaPLeOptimizer=Baseline2026.07 | 68.69 | |
| KgCoOp2025.09 | 68.5 | |
| Co-CoOp2025.09 | 68.21 | |
| CoCoOpOptimizer=Baseline2026.07 | 68.21 | |
| CoCoOpTraining shots=16-shot, Source dataset=ImageNet, Training epochs=32026.03 | 68.2 | |
| Image-TextIntra-modal=✗, Classifier=Zero-Shot, Backbone=ViT-B/16-open2026.03 | 67.8 | |
| CoOp + SAMPLeOptimizer=SAMPLe2026.07 | 67.64 | |
| CLIP-1Setting=Inductive, Test-Time Adaptation (TTA)=false2025.06 | 67.5 | |
| TIP-XShot=4, Backbone=ResNet-502026.03 | 66.9 | |
| CLIP2025.09 | 66.83 | |
| CoOpTraining shots=16-shot, Source dataset=ImageNet, Training epochs=32026.03 | 66.6 | |
| CoOp2025.09 | 66.55 | |
| CoOpOptimizer=Baseline2026.07 | 66.55 | |
| TIP-AdapterShot=4, Backbone=ResNet-502026.03 | 66.5 | |
| Align+MixShot=1, Backbone=ResNet-502026.03 | 64.3 | |
| ProGrad2025.09 | 64.29 | |
| TIP-XShot=1, Backbone=ResNet-502026.03 | 62.8 | |
| TIP-AdapterShot=1, Backbone=ResNet-502026.03 | 62.6 | |
| CALIPShot=0, Backbone=ResNet-502026.03 | 61.7 | |
| CLIPShots=0, Venue=ICML’222026.03 | 61.5 | |
| CLIPShot=0, Backbone=ResNet-502026.03 | 61.5 | |
| GDAShot=1, Backbone=ResNet-502026.03 | 61.2 | |
| CLIP-2Setting=Inductive, Test-Time Adaptation (TTA)=false2025.06 | 58.8 |