Image Classification on CUB (Standard)
94.4AccuracyNTS-C MT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| NTS-C MTBackbone=NTS-Net, Multi-task Learning Setting=Multi-Task with coupling2024.01 | 94.4 | — | — | — | |
| LST+MAPBackbone=WideResNet, Shot=1-shot2021.02 | 91.68 | — | — | — | |
| PT+MAPBackbone=WideResNet, Shot=1-shot2021.02 | 91.55 | — | — | — | |
| GEOMMeta-Album Size=Extended, Training Dataset=Meta-Album2025.07 | 90.39 | — | — | — | |
| PT+GMMBackbone=WideResNet, Shot=1-shot2021.02 | 90.06 | — | — | — | |
| LST+GMMBackbone=WideResNet, Shot=1-shot2021.02 | 89.9 | — | — | — | |
| NTS-NC MTBackbone=NTS-Net, Multi-task Learning Setting=Multi-Task without coupling2024.01 | 89.6 | — | — | — | |
| LST+KNNBackbone=WideResNet, Shot=1-shot2021.02 | 89.26 | — | — | — | |
| PT+KNNBackbone=WideResNet, Shot=1-shot2021.02 | 89.07 | — | — | — | |
| GEOMMeta-Album Size=Mini, Training Dataset=Meta-Album2025.07 | 88.94 | — | — | — | |
| NTS-STBackbone=NTS-Net, Multi-task Learning Setting=Single-Task2024.01 | 87.5 | — | — | — | |
| MGDA-UBBackbone=ResNet-50, Multi-task Learning Setting=Multi-Task2024.01 | 86.3 | — | — | — | |
| AdaShareBackbone=ResNet-50, Multi-task Learning Setting=Multi-Task2024.01 | 86.2 | — | — | — | |
| GradNormBackbone=ResNet-50, Multi-task Learning Setting=Multi-Task2024.01 | 86 | — | — | — | |
| DOT-CBM2025.05 | 85.39 | — | — | — | |
| Spot-tuneBackbone=ResNet-50, Param Count=7x (7x)2022.03 | 84.03 | — | — | — | |
| Fine-TuningBackbone=ResNet-50, Param Count=6x2022.03 | 83.61 | — | — | — | |
| TRBackbone=ResNet-50, Multi-task Learning Setting=Multi-Task2024.01 | 83.23 | — | — | — | |
| IndividualBackbone=DeiT-S2022.03 | 82.69 | — | — | — | |
| TAPSBackbone=ResNet-50, Param Count=4.12x2022.03 | 82.65 | — | — | — | |
| WTPBBackbone=ResNet-50, Param Count=6x (2.25x)2022.03 | 82.6 | — | — | — | |
| CoopCBM2025.05 | 82.1 | — | — | — | |
| SparseCBM2025.05 | 82.07 | — | — | — | |
| PiggybackBackbone=ResNet-50, Param Count=6x (2.25x)2022.03 | 81.59 | — | — | — | |
| MEATBackbone=DeiT-S2022.03 | 81.53 | — | — | — | |
| LaBo2025.05 | 81.3 | — | — | — | |
| MSNBackbone=ViT-L/7, IbM2=true, Shot per Class=162023.05 | 81.2 | — | — | — | |
| BA^2Backbone=ResNet-50, Param Count=3.8x (1.71x)2022.03 | 81.19 | — | — | — | |
| SupervisedStage 2 pre-training=false, Evaluation protocol=fine-tuned evaluation, Stage 1 pre-training dataset=ImageNet-1k, Backbone=ResNet-50, Pre-training epochs=8002021.06 | 81.02 | — | — | — | |
| Linear ProbeBackbone=CLIP ViT-B/162025.10 | 81 | — | — | — | |
| CEM2025.05 | 80.47 | — | — | — | |
| PacknetBackbone=ResNet-50, Param Count=(1.60x), Task Adding Order=Forward2022.03 | 80.4 | — | — | — | |
| MSNBackbone=ViT-L/7, IbM2=false, Shot per Class=162023.05 | 80.4 | — | — | — | |
| HATBackbone=DeiT-S2022.03 | 79.67 | — | — | — | |
| Ours (T*csgcn)Backbone=SwinT, Training Scenario=FT2025.04 | 79.67 | — | — | — | |
| GEOM-INTraining Dataset=ImageNet-1k2025.07 | 79.64 | — | — | — | |
| CDMBackbone=CLIP ViT-B/162025.10 | 79.5 | — | — | — | |
| FLYPModel=ViT, Method=FLYP2026.01 | 79.25 | — | — | — | |
| Ours (T*cn)Backbone=SwinT, Training Scenario=FT2025.04 | 79.19 | — | — | — | |
| DINOBackbone=ViT-S/16, IbM2=true, Shot per Class=162023.05 | 79 | — | — | — | |
| KD+ATS+EnsTeacher=RNX101-32-8d, Student=MV22022.10 | 78.97 | — | 63.54 | — | |
| MMFTModel=ViT, Method=Ours2026.01 | 78.75 | — | — | — | |
| Vanilla-CBM2025.05 | 78.32 | — | — | — | |
| DINOBackbone=ViT-S/16, IbM2=false, Shot per Class=162023.05 | 78.2 | — | — | — | |
| Ours (T*csg)Backbone=SwinT, Training Scenario=FT2025.04 | 77.99 | — | — | — | |
| KD+ATSTeacher=RNX101-32-8d, Student=MV22022.10 | 77.83 | — | 60.88 | — | |
| EnsTeacher=RNX101-32-8d, Student=MV22022.10 | 77.47 | — | 61.82 | — | |
| SP. o.Data=100%, Epoch=90, Time (/h)=39, Teacher Backbone=ResNet-50, Student Backbone=ResNet-18, Evaluation Protocol=fine-tuned2022.03 | 77.44 | — | — | — | |
| SEG-MIL-CBMBackbone=CLIP ViT-B/162025.10 | 77.39 | — | — | — | |
| KDEPData=100%, Epoch=90, Time (/h)=40, Teacher Backbone=ResNet-50, Student Backbone=ResNet-18, Evaluation Protocol=fine-tuned2022.03 | 77.29 | — | — | — | |
| Adaptor-BBackbone=DeiT-S2022.03 | 77.2 | — | — | — | |
| BYOL+CVSAStage 2 pre-training=true, Evaluation protocol=fine-tuned evaluation, Stage 1 pre-training dataset=ImageNet-1k, Backbone=ResNet-50, Pre-training epochs=8002021.06 | 77.1 | — | — | — | |
| Ours (T*csg)Backbone=ResNet50, Training Scenario=FT2025.04 | 76.92 | — | — | — | |
| KDEPData=10%, Epoch=900, Time (/h)=40, Teacher Backbone=ResNet-50, Student Backbone=ResNet-18, Evaluation Protocol=fine-tuned2022.03 | 76.89 | — | — | — | |
| ESKDTeacher=RNX101-32-8d, Student=MV22022.10 | 76.87 | — | 59.01 | — | |
| ST-KDTeacher=RNX101-32-8d, Student=MV22022.10 | 76.8 | — | 59.77 | — | |
| T = 1Backbone=SwinT, Training Scenario=FT2025.04 | 76.77 | — | — | — | |
| DCBM-MASKRCNNBackbone=CLIP ViT-B/162025.10 | 76.7 | — | — | — | |
| Black-box2026.03 | 76.67 | — | — | — | |
| BYOLStage 2 pre-training=false, Evaluation protocol=fine-tuned evaluation, Stage 1 pre-training dataset=ImageNet-1k, Backbone=ResNet-50, Pre-training epochs=8002021.06 | 76.63 | — | — | — | |
| BYOL+DiLoStage 2 pre-training=true, Evaluation protocol=fine-tuned evaluation, Stage 1 pre-training dataset=ImageNet-1k, Backbone=ResNet-50, Pre-training epochs=8002021.06 | 76.6 | — | — | — | |
| KDEPData=100%, Epoch=18, Time (/h)=8, Teacher Backbone=ResNet-50, Student Backbone=ResNet-18, Evaluation Protocol=fine-tuned2022.03 | 76.5 | — | — | — | |
| Ours (T*csgcn)Backbone=ResNet50, Training Scenario=FT2025.04 | 76.49 | — | — | — | |
| KDTeacher=RNX101-32-8d, Student=MV22022.10 | 76.45 | — | 58.89 | — | |
| KDEPData=100%, Epoch=90, Time (/h)=43, Fine-tuning=true, Pre-trained Backbone=ResNet-50, Student Architecture=MobileNetV22022.03 | 76.4 | — | — | — | |
| SP. o.Data=100%, Epoch=90, Time (/h)=42, Fine-tuning=true, Pre-trained Backbone=ResNet-50, Student Architecture=MobileNetV22022.03 | 76.34 | — | — | — | |
| ResKDTeacher=RNX101-32-8d, Student=MV22022.10 | 76.27 | — | 62.26 | — | |
| KD+ATS+EnsTeacher=RNX101-32-8d, Student=SFV22022.10 | 76.26 | — | 63.54 | — | |
| TAKDTeacher=RNX101-32-8d, Student=MV22022.10 | 76.25 | — | 58.87 | — | |
| SALF-CBMBackbone=CLIP ViT-B/162025.10 | 76.2 | — | — | — | |
| KDEPData=10%, Epoch=900, Time (/h)=43, Fine-tuning=true, Pre-trained Backbone=ResNet-50, Student Architecture=MobileNetV22022.03 | 76.06 | — | — | — | |
| KDEPData=100%, Epoch=18, Time (/h)=8.6, Fine-tuning=true, Pre-trained Backbone=ResNet-50, Student Architecture=MobileNetV22022.03 | 76 | — | — | — | |
| KDEPData=10%, Epoch=180, Time (/h)=8, Teacher Backbone=ResNet-50, Student Backbone=ResNet-18, Evaluation Protocol=fine-tuned2022.03 | 75.99 | — | — | — | |
| InsLocStage 2 pre-training=true, Evaluation protocol=fine-tuned evaluation, Stage 1 pre-training dataset=ImageNet-1k, Backbone=ResNet-50, Pre-training epochs=8002021.06 | 75.83 | — | — | — | |
| Ours (T*cn)Backbone=ResNet50, Training Scenario=FT2025.04 | 75.46 | — | — | — | |
| DCBM-SAM2Backbone=CLIP ViT-B/162025.10 | 75.3 | — | — | — | |
| ResKDTeacher=RNX101-32-8d, Student=SFV22022.10 | 75.29 | — | 62.26 | — | |
| KDEPData=10%, Epoch=180, Time (/h)=8.6, Fine-tuning=true, Pre-trained Backbone=ResNet-50, Student Architecture=MobileNetV22022.03 | 75.28 | — | — | — | |
| IndividualBackbone=DeiT-Ti2022.03 | 75.13 | — | — | — | |
| SCKDTeacher=RNX101-32-8d, Student=MV22022.10 | 75.13 | — | 59.04 | — | |
| Insert LNBackbone=ResNet50, Training Scenario=FT2025.04 | 75.13 | — | — | — | |
| KDEPData=100%, Epoch=9, Time (/h)=4, Teacher Backbone=ResNet-50, Student Backbone=ResNet-18, Evaluation Protocol=fine-tuned2022.03 | 75.11 | — | — | — | |
| T = 1Backbone=ResNet50, Training Scenario=FT2025.04 | 75.03 | — | — | — | |
| KDEPData=100%, Epoch=9, Time (/h)=4.3, Fine-tuning=true, Pre-trained Backbone=ResNet-50, Student Architecture=MobileNetV22022.03 | 74.76 | — | — | — | |
| SP. b.Data=100%, Epoch=18, Time (/h)=8.4, Fine-tuning=true, Pre-trained Backbone=ResNet-50, Student Architecture=MobileNetV22022.03 | 74.64 | — | — | — | |
| SP. b.Data=100%, Epoch=18, Time (/h)=7.8, Teacher Backbone=ResNet-50, Student Backbone=ResNet-18, Evaluation Protocol=fine-tuned2022.03 | 74.63 | — | — | — | |
| Insert LNBackbone=SwinT, Training Scenario=FT2025.04 | 74.53 | — | — | — | |
| NoKDTeacher=RNX101-32-8d, Student=MV22022.10 | 74.49 | — | 57.94 | — | |
| IndividualBackbone=T2T-ViT-122022.03 | 74.47 | — | — | — | |
| EnsTeacher=RNX101-32-8d, Student=SFV22022.10 | 74.43 | — | 61.82 | — | |
| KDEPData=10%, Epoch=90, Time (/h)=4.3, Fine-tuning=true, Pre-trained Backbone=ResNet-50, Student Architecture=MobileNetV22022.03 | 74.24 | — | — | — | |
| KDEPData=10%, Epoch=90, Time (/h)=4, Teacher Backbone=ResNet-50, Student Backbone=ResNet-18, Evaluation Protocol=fine-tuned2022.03 | 74.2 | — | — | — | |
| M-CBMSparsity=NCC=avg2026.03 | 74.18 | — | — | — | |
| DCBM-GDINOBackbone=CLIP ViT-B/162025.10 | 74.1 | — | — | — | |
| Label-Free-CBMBackbone=CLIP ViT-B/162025.10 | 74 | — | — | — | |
| SimCLRStage 2 pre-training=false, Evaluation protocol=fine-tuned evaluation, Stage 1 pre-training dataset=ImageNet-1k, Backbone=ResNet-50, Pre-training epochs=8002021.06 | 73.99 | — | — | — | |
| M-CBMSparsity=NCC=52026.03 | 73.7 | — | — | — | |
| SP. b.Data=10%, Epoch=180, Time (/h)=8.4, Fine-tuning=true, Pre-trained Backbone=ResNet-50, Student Architecture=MobileNetV22022.03 | 73.62 | — | — | — | |
| R12Student Model=LCNet-35, Teacher Selection Metric=R122026.05 | 73.5 | — | — | — | |
| SP. b.Data=100%, Epoch=9, Time (/h)=4.2, Fine-tuning=true, Pre-trained Backbone=ResNet-50, Student Architecture=MobileNetV22022.03 | 73.33 | — | — | — |