Image Classification on Food (Accuracy)
94.9AccuracyCLIP* L/14
Evaluation Results
| Method | Links | |
|---|---|---|
| CLIP* L/14MAP head=true, Grain=Fine, Frozen representation=true, backbone=ViT-L/142023.06 | 94.9 | |
| CapPa L/14MAP head=true, Grain=Fine, Frozen representation=true, backbone=ViT-L/142023.06 | 94.2 | |
| CLIP* (16k)MAP head=true, Grain=Fine, Frozen representation=true2023.06 | 92.1 | |
| ZSModel=MLLM, Method=ZS2026.01 | 91.85 | |
| CapPaMAP head=true, Grain=Fine, Frozen representation=true2023.06 | 91.5 | |
| CapMAP head=true, Grain=Fine, Frozen representation=true2023.06 | 91.1 | |
| CLIP* (8k)MAP head=true, Grain=Fine, Frozen representation=true2023.06 | 91 | |
| GPUASamples per class=full training set2026.06 | 89.5 | |
| MMFTModel=ViT, Method=Ours2026.01 | 88.79 | |
| GPUA*Samples per class=162026.06 | 87.9 | |
| FLYPModel=ViT, Method=FLYP2026.01 | 87.88 | |
| MMFTModel=RN50, Method=Ours2026.01 | 87.61 | |
| CoCoOpShot=162026.05 | 87.4 | |
| FTModel=ViT, Method=FT2026.01 | 87.23 | |
| KgCoOpShot=162026.05 | 87.2 | |
| CLIP-AdapterShot=162026.05 | 87.1 | |
| PLOT++Shot=162026.05 | 87.1 | |
| StatA2026.06 | 87.1 | |
| FLYPModel=RN50, Method=FLYP2026.01 | 86.93 | |
| KgCoOpShot=42026.05 | 86.9 | |
| ZLaP2026.06 | 86.9 | |
| TIP-AdapterShot=162026.05 | 86.8 | |
| ZERO2026.06 | 86.8 | |
| COSMICInference-time adaptation=true2026.06 | 86.6 | |
| TIP-AdapterShot=42026.05 | 86.5 | |
| CLIP-AdapterShot=42026.05 | 86.5 | |
| PLOT++Shot=42026.05 | 86.5 | |
| PARA2026.04 | 86.4 | |
| KgCoOpShot=12026.05 | 86.4 | |
| FTModel=RN50, Method=FT2026.01 | 86.32 | |
| CoCoOpShot=42026.05 | 86.3 | |
| PLOT++Shot=12026.05 | 86.2 | |
| DPE2026.06 | 86.2 | |
| CLIPShot=02026.05 | 86.1 | |
| CLIP-AdapterShot=12026.05 | 86.1 | |
| TDA2026.06 | 86.1 | |
| CLIP ViT-B/16Img. encoder=CLIP ViT-B/162026.05 | 86.04 | |
| CoCoOpFMA=false2025.10 | 86 | |
| TIPPLEInference-time adaptation=true2026.06 | 86 | |
| CLIPFMA=false2025.10 | 85.9 | |
| CLIP2026.06 | 85.9 | |
| TIP-AdapterShot=12026.05 | 85.8 | |
| ProGradShot=162026.05 | 85.8 | |
| +DP-FMShot=162026.05 | 85.8 | |
| ProGradShot=42026.05 | 85.4 | |
| CLIPFMA=true2025.10 | 85.2 | |
| CoCoOpFMA=true2025.10 | 85.2 | |
| CLIP-LoRAShot=12026.05 | 85.1 | |
| DMN2026.06 | 85.1 | |
| +DP-FMShot=12026.05 | 85 | |
| MTA2026.06 | 85 | |
| CoCoOpShot=12026.05 | 84.9 | |
| ProGradShot=12026.05 | 84.9 | |
| LoRAFMA=false2025.10 | 84.5 | |
| CoOpShot=42026.05 | 84.5 | |
| CoOpShot=162026.05 | 84.4 | |
| CoOpShot=12026.05 | 84.3 | |
| AdapterFMA=false2025.10 | 84.2 | |
| CLIP-LoRAShot=162026.05 | 84.2 | |
| +DP-FMShot=42026.05 | 83.7 | |
| LoRAFMA=true2025.10 | 83.6 | |
| AdapterFMA=true2025.10 | 83.3 | |
| CLIP-LoRAShot=42026.05 | 82.6 | |
| CoOpFMA=false2025.10 | 80.8 | |
| GoRA2026.04 | 80.66 | |
| CLIP ViT-B/32Img. encoder=CLIP ViT-B/322026.05 | 80.53 | |
| CoOpFMA=true2025.10 | 80.2 | |
| CLIP RN-101Img. encoder=CLIP RN-1012026.05 | 79.83 | |
| LoRA2026.04 | 79.43 | |
| LGCLIPBackbone=ViT-L/14, Correction (Manual Calibration)=false2025.12 | 78.98 | |
| ZSModel=ViT, Method=ZS2026.01 | 77.66 | |
| ZSModel=RN50, Method=ZS2026.01 | 76.67 | |
| CLIP RN-50Img. encoder=CLIP RN-502026.05 | 75.99 | |
| CLIPBackbone=ViT-L/14, Correction (Manual Calibration)=false2025.12 | 75.4 | |
| DoRA2026.04 | 74.49 | |
| SoRA2026.04 | 72.19 | |
| LGCLIPBackbone=ViT-B/16, Correction (Manual Calibration)=false2025.12 | 71.13 | |
| CLIPBackbone=ViT-B/16, Correction (Manual Calibration)=false2025.12 | 69.97 | |
| AdaLoRA2026.04 | 68.43 | |
| LGCLIPBackbone=ViT-B/32, Correction (Manual Calibration)=false2025.12 | 63.17 | |
| ConvNext-B + CLIPImg. encoder=ConvNext-B, Txt. encoder=CLIP2026.05 | 60.29 | |
| CLIPBackbone=ViT-B/32, Correction (Manual Calibration)=false2025.12 | 60.15 | |
| CAFormer-S18 + CLIPImg. encoder=CAFormer-S18, Txt. encoder=CLIP2026.05 | 59.83 | |
| TinyViT-21M + CLIPImg. encoder=TinyViT-21M, Txt. encoder=CLIP2026.05 | 57.3 | |
| BEiT-B/16 + CLIPImg. encoder=BEiT-B/16, Txt. encoder=CLIP2026.05 | 57.12 | |
| ConvFormer-S18 + CLIPImg. encoder=ConvFormer-S18, Txt. encoder=CLIP2026.05 | 54.92 | |
| LGCLIPBackbone=RN50, Correction (Manual Calibration)=false2025.12 | 52.61 | |
| CLIPBackbone=RN50, Correction (Manual Calibration)=false2025.12 | 51.12 | |
| CAFormer-S18 + RoBERTaImg. encoder=CAFormer-S18, Txt. encoder=RoBERTa2026.05 | 34.54 | |
| CAFormer-S18 + MPNetImg. encoder=CAFormer-S18, Txt. encoder=MPNet2026.05 | 32.69 | |
| ConvFormer-S18 + RoBERTaImg. encoder=ConvFormer-S18, Txt. encoder=RoBERTa2026.05 | 32.3 | |
| ConvFormer-S18 + MPNetImg. encoder=ConvFormer-S18, Txt. encoder=MPNet2026.05 | 30.61 | |
| ConvNext-B + MPNetImg. encoder=ConvNext-B, Txt. encoder=MPNet2026.05 | 30.52 | |
| BEiT-B/16 + RoBERTaImg. encoder=BEiT-B/16, Txt. encoder=RoBERTa2026.05 | 29.48 | |
| ConvNext-B + RoBERTaImg. encoder=ConvNext-B, Txt. encoder=RoBERTa2026.05 | 28.75 | |
| ConvNext-B + MiniLMImg. encoder=ConvNext-B, Txt. encoder=MiniLM2026.05 | 27.55 | |
| BEiT-B/16 + MPNetImg. encoder=BEiT-B/16, Txt. encoder=MPNet2026.05 | 27.2 | |
| TinyViT-21M + MPNetImg. encoder=TinyViT-21M, Txt. encoder=MPNet2026.05 | 26.59 | |
| BEiT-B/16 + MiniLMImg. encoder=BEiT-B/16, Txt. encoder=MiniLM2026.05 | 25.24 | |
| TinyViT-21M + RoBERTaImg. encoder=TinyViT-21M, Txt. encoder=RoBERTa2026.05 | 22.09 |