Fine-grained Image Classification on iNaturalist Aves 16-shot 2018 (test)
69.4AccuracyFew-shot FT + POC
Evaluation Results
| Method | Links | |
|---|---|---|
| Few-shot FT + POCstrategy=finetuning, variant=POC, shots=16, backbone=OpenCLIP ViT-B/32, LMM=Qwen-2.5-VL-7B2025.12 | 69.4 | |
| CLAP + POCstrategy=linear probing, variant=POC, shots=16, backbone=OpenCLIP ViT-B/32, LMM=Qwen-2.5-VL-7B2025.12 | 67.8 | |
| Few-shot LP + POCstrategy=linear probing, variant=POC, shots=16, backbone=OpenCLIP ViT-B/32, LMM=Qwen-2.5-VL-7B2025.12 | 67.7 | |
| CrossModal LP + POCstrategy=linear probing, variant=POC, shots=16, backbone=OpenCLIP ViT-B/32, LMM=Qwen-2.5-VL-7B2025.12 | 66 | |
| CLIP-Adapter + POCstrategy=adapter learning, variant=POC, shots=16, backbone=OpenCLIP ViT-B/32, LMM=Qwen-2.5-VL-7B2025.12 | 63.6 | |
| FineR + POCstrategy=non-learned, variant=POC, shots=16, backbone=OpenCLIP ViT-B/32, LMM=Qwen-2.5-VL-7B2025.12 | 62.5 | |
| CoOp + POCstrategy=prompt learning, variant=POC, shots=16, backbone=OpenCLIP ViT-B/32, LMM=Qwen-2.5-VL-7B2025.12 | 62 | |
| MaPLe + POCstrategy=prompt learning, variant=POC, shots=16, backbone=OpenCLIP ViT-B/32, LMM=Qwen-2.5-VL-7B2025.12 | 61 | |
| Tip-Adapter + POCstrategy=adapter learning, variant=POC, shots=16, backbone=OpenCLIP ViT-B/32, LMM=Qwen-2.5-VL-7B2025.12 | 59.6 | |
| Few-shot FTstrategy=finetuning, variant=expert, shots=16, backbone=OpenCLIP ViT-B/322025.12 | 58.2 | |
| CLAPstrategy=linear probing, variant=expert, shots=16, backbone=OpenCLIP ViT-B/322025.12 | 57 | |
| Few-shot LPstrategy=linear probing, variant=expert, shots=16, backbone=OpenCLIP ViT-B/322025.12 | 53.8 | |
| CrossModal LPstrategy=linear probing, variant=expert, shots=16, backbone=OpenCLIP ViT-B/322025.12 | 53.3 | |
| CLIP-Adapterstrategy=adapter learning, variant=expert, shots=16, backbone=OpenCLIP ViT-B/322025.12 | 50.9 | |
| CoOpstrategy=prompt learning, variant=expert, shots=16, backbone=OpenCLIP ViT-B/322025.12 | 48.2 | |
| Tip-Adapterstrategy=adapter learning, variant=expert, shots=16, backbone=OpenCLIP ViT-B/322025.12 | 47.7 | |
| FineRstrategy=non-learned, variant=expert, shots=16, backbone=OpenCLIP ViT-B/322025.12 | 47.5 | |
| MaPLestrategy=prompt learning, variant=expert, shots=16, backbone=OpenCLIP ViT-B/322025.12 | 47.4 |