Image Classification on ImageNet-S (Full Metrics)
79.74Top-1 AccuracyLIMA (Ours)
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| LIMA (Ours)Human Prior=Masks, Model=CLIP (Radford et al., 2021), Attributions=LIMA2026.01 | 79.74 | 88.95 | 77.12 | 83.77 | 834 | |
| Fine-tuningHuman Prior=Masks, Model=CLIP (Radford et al., 2021), Attributions=-2026.01 | 79.69 | 88.88 | 70.01 | 70.93 | 218 | |
| RRRHuman Prior=Masks, Model=CLIP (Radford et al., 2021), Attributions=Input Gradient2026.01 | 78.98 | 88.61 | 70.51 | 76.42 | 543 | |
| MEGLHuman Prior=Masks, Model=CLIP (Radford et al., 2021), Attributions=Grad-ECLIP2026.01 | 78.57 | 87.95 | 75.56 | 79.42 | 305 | |
| XILHuman Prior=Masks, Model=CLIP (Radford et al., 2021), Attributions=Grad-ECLIP2026.01 | 78.07 | 87.86 | 75.35 | 80.42 | 242 | |
| LIMA (Ours)Human Prior=Masks, Model=ResNet-101 (He et al., 2016), Attributions=LIMA2026.01 | 72.45 | 81.86 | 86.72 | 90.4 | 239 | |
| XILHuman Prior=Masks, Model=ResNet-101 (He et al., 2016), Attributions=Grad-CAM2026.01 | 72.25 | 81.82 | 84.91 | 89.04 | 114 | |
| MEGLHuman Prior=Masks, Model=ResNet-101 (He et al., 2016), Attributions=Grad-CAM2026.01 | 72.12 | 81.58 | 83.03 | 85.22 | 129 | |
| LIMA (Ours)Human Prior=Masks, Model=ViT (base) (Dosovitskiy et al., 2021), Attributions=LIMA2026.01 | 72.08 | 80.87 | 82.26 | 88.78 | 254 | |
| RRRHuman Prior=Masks, Model=ResNet-101 (He et al., 2016), Attributions=Input Gradient2026.01 | 70.73 | 80.76 | 83.64 | 85.32 | 110 | |
| Fine-tuningHuman Prior=Masks, Model=ResNet-101 (He et al., 2016), Attributions=-2026.01 | 70.71 | 80.11 | 84.53 | 88.14 | 23 | |
| MEGLHuman Prior=Masks, Model=ViT (base) (Dosovitskiy et al., 2021), Attributions=Grad-ECLIP2026.01 | 69.69 | 80.24 | 81.43 | 86.54 | 118 | |
| XILHuman Prior=Masks, Model=ViT (base) (Dosovitskiy et al., 2021), Attributions=Grad-ECLIP2026.01 | 69.52 | 79.71 | 80.35 | 85.14 | 114 | |
| RRRHuman Prior=Masks, Model=ViT (base) (Dosovitskiy et al., 2021), Attributions=Input Gradient2026.01 | 68.68 | 79.12 | 79.23 | 85.8 | 130 | |
| Fine-tuningHuman Prior=Masks, Model=ViT (base) (Dosovitskiy et al., 2021), Attributions=-2026.01 | 67.13 | 77.28 | 80.41 | 87.62 | 104 | |
| ITOBackbone=ViT-L/16, Pre-training Dataset=DataComp-1B, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 62 | — | — | — | — | |
| ITOPre-training Dataset=DataComp-1B, Backbone=ViT-B/16, Training Epochs=10 epochs, Zero-shot protocol=EVA-CLIP2026.03 | 62 | — | — | — | — | |
| ITO sub2Pre-training Dataset=DataComp-1B, Backbone=ViT-B/16, Training Epochs=10 epochs, Zero-shot protocol=EVA-CLIP2026.03 | 60.7 | — | — | — | — | |
| ITO sub2Backbone=ViT-L/16, Pre-training Dataset=DataComp-1B, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 59.4 | — | — | — | — | |
| CLIPPre-training Dataset=DataComp-1B, Backbone=ViT-B/16, Training Epochs=10 epochs, Zero-shot protocol=EVA-CLIP2026.03 | 58.6 | — | — | — | — | |
| CLIPBackbone=ViT-L/16, Pre-training Dataset=DataComp-1B, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 56.5 | — | — | — | — | |
| ITO sub3Backbone=ViT-B/16, Pre-training Dataset=CC3M-recap, Evaluation Protocol=Zero-shot2026.03 | 20.7 | — | — | — | — | |
| ITO sub2Backbone=ViT-B/16, Pre-training Dataset=CC3M-recap, Evaluation Protocol=Zero-shot2026.03 | 19.9 | — | — | — | — | |
| FLAIRBackbone=ViT-B/16, Pre-training Dataset=CC3M-recap, Evaluation Protocol=Zero-shot2026.03 | 15 | — | — | — | — |