Out-of-Distribution Detection on ImageNet-1k (ID) vs 4 OOD Datasets (iNaturalist, SUN, Places, Textures)
12.79FPR95Ours (Mean)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Ours (Mean)Training Protocol=Zero-shot Training-free, Encoder=ViT B/16 CLIP2026.05 | 12.79 | 97.75 | — | |
| CSPTraining Protocol=Zero-shot Training-free, Encoder=ViT B/16 CLIP2026.05 | 17.51 | 95.76 | — | |
| AdaNeg+NegLabelTraining Protocol=Zero-shot Training-free, Encoder=ViT B/16 CLIP2026.05 | 18.92 | 96.66 | — | |
| ReAct + NNGuideBackbone=ResNet-50, Venue=reproduced2023.09 | 19.72 | 95.45 | 98.98 | |
| InfoOODTraining Protocol=Zero-shot Training-free, Encoder=ViT B/16 CLIP2026.05 | 21.2 | 95.07 | — | |
| DNMTraining Protocol=Zero-shot Training-free, Encoder=ViT B/16 CLIP2026.05 | 22.33 | 94.52 | — | |
| ASH*Backbone=ResNet-50, Venue=Arxiv' 222023.09 | 22.73 | 95.06 | — | |
| NegPromptTraining Protocol=Training/Fine-tuning, Encoder=ViT B/16 CLIP2026.05 | 23.01 | 94.81 | — | |
| LAPTTraining Protocol=Training/Fine-tuning, Encoder=ViT B/16 CLIP2026.05 | 23.4 | 94.68 | — | |
| ReAct + GradNormBackbone=ResNet-50, Venue=reproduced2023.09 | 25.13 | 94.22 | 98.72 | |
| NegLabel2024.09 | 25.4 | 94.21 | — | |
| NegLabelTraining Protocol=Zero-shot Training-free, Encoder=ViT B/16 CLIP2026.05 | 25.4 | 94.21 | — | |
| ReAct + ViMBackbone=ResNet-50, Venue=reproduced2023.09 | 26.06 | 94.83 | 98.85 | |
| BATS*Backbone=ResNet-50, Venue=NeurIPS'222023.09 | 27.11 | 94.28 | — | |
| ReAct + DICE*Backbone=ResNet-50, Venue=ECCV'222023.09 | 27.25 | 93.4 | — | |
| LoCoOpTraining Protocol=Training/Fine-tuning, Encoder=ViT B/16 CLIP2026.05 | 28.66 | 93.52 | — | |
| caption-level textual outliersExposure Category=Textual, Outlier Level=Caption, Backbone=CLIP-RN502023.10 | 29.61 | 94.74 | — | |
| LSNTraining Protocol=Training/Fine-tuning, Encoder=ViT B/16 CLIP2026.05 | 30.22 | 92.96 | — | |
| CLIPN2024.09 | 31.1 | 93.1 | — | |
| CLIPNTraining Protocol=Training/Fine-tuning, Encoder=ViT B/16 CLIP2026.05 | 31.1 | 93.1 | — | |
| ReAct (+ Energy)*Backbone=ResNet-50, Venue=NeurIPS'212023.09 | 31.43 | 92.95 | — | |
| DAL-ASHTraining Data Setup=Using ID data and auxiliary OOD data, Backbone=ResNet-502023.11 | 31.71 | 90.24 | — | |
| word-level textual outliersExposure Category=Textual, Outlier Level=Word, Backbone=CLIP-RN502023.10 | 31.72 | 94.56 | — | |
| ReAct + KLBackbone=ResNet-50, Venue=reproduced2023.09 | 32.69 | 93.07 | 98.54 | |
| ReAct + EnergyBackbone=ResNet-50, Venue=reproduced2023.09 | 32.69 | 93.07 | 98.54 | |
| description-level textual outliersExposure Category=Textual, Outlier Level=Description, Backbone=CLIP-RN502023.10 | 33.12 | 94.28 | — | |
| HFTT2024.09 | 33.33 | 91.76 | — | |
| DICE*Backbone=ResNet-50, Venue=ECCV'222023.09 | 34.75 | 90.77 | — | |
| GL-MCMTraining Protocol=Zero-shot Training-free, Encoder=ViT B/16 CLIP2026.05 | 35.06 | 90.9 | — | |
| RankFeat*Backbone=ResNet-101, Venue=NeurIPS'222023.09 | 36.8 | 92.15 | — | |
| NPOSTraining Protocol=Training/Fine-tuning, Encoder=ViT B/16 CLIP2026.05 | 37.93 | 91.22 | — | |
| DAL-EnergyTraining Data Setup=Using ID data and auxiliary OOD data, Backbone=ResNet-502023.11 | 39.45 | 84.55 | — | |
| EnergyTraining Protocol=Training/Fine-tuning, Encoder=ViT B/16 CLIP2026.05 | 39.89 | 91.54 | — | |
| ReAct + MaxLogitBackbone=ResNet-50, Venue=reproduced2023.09 | 39.97 | 91.8 | 98.29 | |
| VOSTraining Protocol=Training/Fine-tuning, Encoder=ViT B/16 CLIP2026.05 | 41.32 | 91.19 | — | |
| DOETraining Data Setup=Using ID data and auxiliary OOD data, Backbone=ResNet-502023.11 | 41.86 | 88.9 | — | |
| KNNTraining Protocol=Training/Fine-tuning, Encoder=ViT B/16 CLIP2026.05 | 42.19 | 90.97 | — | |
| ReAct + KNNBackbone=ResNet-50, Venue=reproduced2023.09 | 42.42 | 89.46 | 97.46 | |
| MCMTraining Protocol=Zero-shot Training-free, Encoder=ViT B/16 CLIP2026.05 | 43.93 | 90.82 | — | |
| POEMTraining Data Setup=Using ID data and auxiliary OOD data, Backbone=ResNet-502023.11 | 44.93 | 85.1 | — | |
| DALTraining Data Setup=Using ID data and auxiliary OOD data, Backbone=ResNet-502023.11 | 46.57 | 85.08 | — | |
| Energy-OETraining Data Setup=Using ID data and auxiliary OOD data, Backbone=ResNet-502023.11 | 46.9 | 86.41 | — | |
| ODINTraining Protocol=Training/Fine-tuning, Encoder=ViT B/16 CLIP2026.05 | 47.75 | 88.8 | — | |
| ReAct + MahalanobisBackbone=ResNet-50, Venue=reproduced2023.09 | 47.9 | 88.27 | 97.26 | |
| ATOMTraining Data Setup=Using ID data and auxiliary OOD data, Backbone=ResNet-502023.11 | 49.36 | 85.41 | — | |
| ViMTraining Protocol=Training/Fine-tuning, Encoder=ViT B/16 CLIP2026.05 | 50.2 | 87.82 | — | |
| ASHTraining Data Setup=Using ID data only, Backbone=ResNet-502023.11 | 50.68 | 85.35 | — | |
| OETraining Data Setup=Using ID data and auxiliary OOD data, Backbone=ResNet-502023.11 | 52.6 | 83.81 | — | |
| ReAct + MSPBackbone=ResNet-50, Venue=reproduced2023.09 | 55.72 | 87.27 | 97.25 | |
| DOEExposure Category=Visual, Backbone=CNN (ResNet/WideResNet)2023.10 | 55.87 | 85.98 | — | |
| ReAct + SSDBackbone=ResNet-50, Venue=reproduced2023.09 | 56.17 | 83.77 | 95.91 | |
| ODIN*Backbone=ResNet-50, Venue=ICLR'182023.09 | 56.48 | 85.41 | — | |
| SSD+Exposure Category=Visual, Backbone=CNN (ResNet/WideResNet)2023.10 | 59.6 | 85.54 | — | |
| KNNTraining Data Setup=Using ID data only, Backbone=ResNet-502023.11 | 63.82 | 79.66 | — | |
| GODIN*Backbone=ResNet-50, Venue=CVPR 202023.09 | 66.07 | 82.02 | — | |
| Free EnergyTraining Data Setup=Using ID data only, Backbone=ResNet-502023.11 | 68.6 | 80.52 | — | |
| MSPTraining Protocol=Training/Fine-tuning, Encoder=ViT B/16 CLIP2026.05 | 69.61 | 81.63 | — | |
| MSPTraining Data Setup=Using ID data only, Backbone=ResNet-502023.11 | 73.04 | 77.84 | — | |
| CSIExposure Category=Visual, Backbone=CNN (ResNet/WideResNet)2023.10 | 75.85 | 82.63 | — | |
| OEExposure Category=Visual, Backbone=CNN (ResNet/WideResNet)2023.10 | 78.31 | 75.23 | — | |
| MixOEExposure Category=Visual, Backbone=CNN (ResNet/WideResNet)2023.10 | 80.51 | 74.3 | — | |
| GradNormTraining Protocol=Training/Fine-tuning, Encoder=ViT B/16 CLIP2026.05 | 80.82 | 72.35 | — | |
| EnergyTraining Protocol=Zero-shot Training-free, Encoder=ViT B/16 CLIP2026.05 | 82.21 | 79.57 | — | |
| MahalanobisTraining Data Setup=Using ID data only, Backbone=ResNet-502023.11 | 82.68 | 62.72 | — | |
| CLIP Baseline (No exposure)Exposure Category=Textual, Outlier Level=None, Backbone=CLIP-RN502023.10 | 84.74 | 74.02 | — | |
| ZOCTraining Protocol=Zero-shot Training-free, Encoder=ViT B/16 CLIP2026.05 | 85.19 | 81.79 | — | |
| VOSTraining Data Setup=Using ID data only, Backbone=ResNet-502023.11 | 87.87 | 61.36 | — | |
| VOSExposure Category=Visual, Backbone=CNN (ResNet/WideResNet)2023.10 | 94.83 | 57.69 | — | |
| MahalanobisTraining Protocol=Zero-shot Training-free, Encoder=ViT B/16 CLIP2026.05 | 98.94 | 61.5 | — |