Out-of-Distribution Detection on SUN OOD with ImageNet-1k In-distribution (test)
98.97AUROCDDE
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DDEZero-shot=true2026.06 | 98.97 | 3.45 | |
| Ours (Mean)Training Protocol=Zero-shot Training-free, Encoder=ViT B/16 CLIP2026.05 | 98.94 | 5 | |
| ANTSTraining Protocol=Zero Shot (No Training Required), Encoder=ViT-B/162025.09 | 98.77 | 5.43 | |
| InterNegArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=no training on ID or extra data2026.03 | 98.68 | 6.78 | |
| DynProtoExternal Text=false, Method Category=Vision Language Model based Methods, Backbone=CLIP-B/162026.04 | 98.55 | 7.37 | |
| NPOSEvaluation Protocol=fine-tuned2023.03 | 98.48 | 9.22 | |
| CSP+DCACArchitecture=CLIP-B/162026.01 | 97.58 | 10.18 | |
| AdaNegArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=no training on ID or extra data2026.03 | 97.44 | 9.5 | |
| AdaNegTraining Protocol=Zero Shot (No Training Required), Encoder=ViT-B/162025.09 | 97.44 | 9.5 | |
| AdaNegExternal Text=true, Method Category=Vision Language Model based Methods, Backbone=CLIP-B/162026.04 | 97.44 | 9.5 | |
| AdaNeg+NegLabelTraining Protocol=Zero-shot Training-free, Encoder=ViT B/16 CLIP2026.05 | 97.44 | 9.5 | |
| AdaNegZero-shot=true2026.06 | 97.44 | 9.5 | |
| OODDZero-shot=true2026.06 | 96.84 | 16.3 | |
| CLIPScopeArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=no training on ID or extra data2026.03 | 96.77 | 15.56 | |
| OSPCoOpArchitecture=CLIP-B/162026.01 | 96.74 | 18.26 | |
| VOS+Evaluation Protocol=fine-tuned2023.03 | 96.69 | 17.58 | |
| CSPArchitecture=CLIP-B/162026.01 | 96.66 | 13.66 | |
| CSPArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=no training on ID or extra data2026.03 | 96.66 | 13.66 | |
| CSPTraining Protocol=Zero Shot (No Training Required), Encoder=ViT-B/162025.09 | 96.66 | 13.66 | |
| CSPExternal Text=true, Method Category=Vision Language Model based Methods, Backbone=CLIP-B/162026.04 | 96.66 | 13.66 | |
| CSPTraining Protocol=Zero-shot Training-free, Encoder=ViT B/16 CLIP2026.05 | 96.66 | 13.66 | |
| CMATraining Protocol=Training-required (or with Fine-tuning), Encoder=ViT-B/162025.09 | 96.36 | 16.84 | |
| ASH-S+DCACArchitecture=ResNet502026.01 | 96.21 | 17.47 | |
| InfoOODTraining Protocol=Zero-shot Training-free, Encoder=ViT B/16 CLIP2026.05 | 96.16 | 16.06 | |
| DynProtoExternal Text=false, Method Category=Vision Model based Methods, Backbone=ResNet-502026.04 | 96.15 | 17.77 | |
| LAPTArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=requiring training on ID or extra data2026.03 | 96.01 | 19.12 | |
| LAPTTraining Protocol=Training-required (or with Fine-tuning), Encoder=ViT-B/162025.09 | 96.01 | 19.12 | |
| LAPTTraining Protocol=Training/Fine-tuning, Encoder=ViT B/16 CLIP2026.05 | 96.01 | 19.12 | |
| MCMEvaluation Protocol=zero-shot2023.03 | 95.95 | 25.05 | |
| DNMTraining Protocol=Zero-shot Training-free, Encoder=ViT B/16 CLIP2026.05 | 95.88 | 16.9 | |
| AdaNDArchitecture=CLIP-B/162026.01 | 95.86 | 17.08 | |
| AdaNDExternal Text=false, Method Category=Vision Language Model based Methods, Backbone=CLIP-B/162026.04 | 95.86 | 17.08 | |
| AdaNDZero-shot=true2026.06 | 95.86 | 17.08 | |
| SUPREMEArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=requiring training on ID or extra data2026.03 | 95.84 | 19.4 | |
| SynOODExternal Text=true, Method Category=Vision Language Model based Methods, Backbone=CLIP-B/162026.04 | 95.83 | 21.63 | |
| SynOODTraining Protocol=Training-required (or with Fine-tuning), Encoder=ViT-B/162025.09 | 95.82 | 20.46 | |
| GradOrthBackbone=ResNet2023.08 | 95.76 | 19.61 | |
| EOEArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=no training on ID or extra data2026.03 | 95.73 | 20.4 | |
| EOETraining Protocol=Zero Shot (No Training Required), Encoder=ViT-B/162025.09 | 95.73 | 20.4 | |
| DDCSArchitecture=ResNet502026.01 | 95.68 | 18.63 | |
| NegPromptArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=requiring training on ID or extra data2026.03 | 95.55 | 22.89 | |
| NegPromptTraining Protocol=Training/Fine-tuning, Encoder=ViT B/16 CLIP2026.05 | 95.55 | 22.89 | |
| NegLabelArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=no training on ID or extra data2026.03 | 95.49 | 20.53 | |
| NegLabelTraining Protocol=Zero Shot (No Training Required), Encoder=ViT-B/162025.09 | 95.49 | 20.53 | |
| NegLabelExternal Text=true, Method Category=Vision Language Model based Methods, Backbone=CLIP-B/162026.04 | 95.49 | 20.53 | |
| NegLabelTraining Protocol=Zero-shot Training-free, Encoder=ViT B/16 CLIP2026.05 | 95.49 | 20.53 | |
| NegLabelZero-shot=true2026.06 | 95.49 | 20.53 | |
| SCTArchitecture=CLIP-B/162026.01 | 95.33 | 20.55 | |
| SCTTraining Protocol=Training-required (or with Fine-tuning), Encoder=ViT-B/162025.09 | 95.33 | 20.55 | |
| HFTTIn-distribution image requirement=Not required2024.09 | 95.28 | 19.24 | |
| LINEArchitecture=ResNet502026.01 | 95.26 | 19.48 | |
| LINeExternal Text=false, Method Category=Vision Model based Methods, Backbone=ResNet-502026.04 | 95.26 | 19.48 | |
| Local-PromptArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=requiring training on ID or extra data2026.03 | 95.12 | 23.23 | |
| ASH-BBackbone=ResNet2023.08 | 95.1 | 22.08 | |
| LoCoOpArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=requiring training on ID or extra data2026.03 | 95.07 | 23.44 | |
| LoCoOpExternal Text=false, Method Category=Vision Language Model based Methods, Backbone=CLIP-B/162026.04 | 95.07 | 23.44 | |
| LoCoOpTraining Protocol=Training/Fine-tuning, Encoder=ViT B/16 CLIP2026.05 | 95.07 | 23.44 | |
| OODDArchitecture=CLIP-B/162026.01 | 95.01 | 21.49 | |
| OODDTraining Protocol=Zero Shot (No Training Required), Encoder=ViT-B/162025.09 | 95.01 | 21.49 | |
| EnergyEvaluation Protocol=fine-tuned2023.03 | 94.77 | 18.42 | |
| NegRefineExternal Text=true, Method Category=Vision Language Model based Methods, Backbone=CLIP-B/162026.04 | 94.64 | 22.93 | |
| NegRefineZero-shot=true2026.06 | 94.63 | 22.93 | |
| ReActArchitecture=ResNet502026.01 | 94.41 | 24.01 | |
| ReActExternal Text=false, Method Category=Vision Model based Methods, Backbone=ResNet-502026.04 | 94.41 | 24.01 | |
| LSNArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=requiring training on ID or extra data2026.03 | 94.35 | 26.32 | |
| LSNTraining Protocol=Training-required (or with Fine-tuning), Encoder=ViT-B/162025.09 | 94.35 | 26.32 | |
| LSNTraining Protocol=Training/Fine-tuning, Encoder=ViT B/16 CLIP2026.05 | 94.35 | 26.32 | |
| VRA-PBackbone=ResNet2023.08 | 94.25 | 26.94 | |
| ReActBackbone=ResNet-502021.11 | 94.2 | 24.2 | |
| ReActBackbone=ResNet-50, Pre-trained=ImageNet-1k2021.11 | 94.2 | 24.2 | |
| ReActBackbone=ResNet2023.08 | 94.2 | 24.2 | |
| MCMBackbone=CLIP-L, Training Protocol=Zero-shot2022.11 | 94.14 | 29 | |
| RankfeatMethods Space=Feature, Backbone=Google BiT-S, Blocks=Block3+42023.11 | 94.07 | 29.27 | |
| ASH-S@95Model=VGG-162022.09 | 94.02 | 47.41 | |
| ASH-SBackbone=ResNet2023.08 | 94.02 | 27.98 | |
| ASH-SArchitecture=ResNet502026.01 | 94.02 | 27.96 | |
| ASH-SExternal Text=false, Method Category=Vision Model based Methods, Backbone=ResNet-502026.04 | 94.02 | 27.96 | |
| DICE + ReActBackbone=ResNet-50, Pre-trained=ImageNet-1k2021.11 | 93.94 | 25.45 | |
| DICE + ReActBackbone=ResNet2023.08 | 93.94 | 25.45 | |
| CLIPNArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=requiring training on ID or extra data2026.03 | 93.93 | 26.17 | |
| CLIPNTraining Protocol=Training-required (or with Fine-tuning), Encoder=ViT-B/162025.09 | 93.93 | 26.17 | |
| CLIPNTraining Protocol=Training/Fine-tuning, Encoder=ViT B/16 CLIP2026.05 | 93.93 | 26.17 | |
| EnergyBackbone=CLIP-L, Training Protocol=Fine-tuned2022.11 | 93.83 | 30.46 | |
| VRA-DNBackbone=ResNet2023.08 | 93.65 | 30.65 | |
| FAExternal Text=false, Method Category=Vision Language Model based Methods, Backbone=CLIP-B/162026.04 | 93.46 | 27.65 | |
| CoVerArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=no training on ID or extra data2026.03 | 93.42 | 32.85 | |
| CoVerTraining Protocol=Zero Shot (No Training Required), Encoder=ViT-B/162025.09 | 93.42 | 32.85 | |
| GL-MCMTraining Protocol=Zero-shot Training-free, Encoder=ViT B/16 CLIP2026.05 | 93.41 | 29.16 | |
| CMAArchitecture=CLIP-B/162026.01 | 93.32 | 29.03 | |
| ViMEvaluation Protocol=fine-tuned2023.03 | 93.31 | 31.68 | |
| ASH-B@65Model=VGG-162022.09 | 93.19 | 30.04 | |
| GradOrthBackbone=MobileNet2023.08 | 93.18 | 30.82 | |
| Fort et al./MSPEvaluation Protocol=fine-tuned2023.03 | 93.16 | 38.56 | |
| EnergyBackbone=CLIP-B, Training Protocol=Fine-tuned2022.11 | 93.15 | 34.28 | |
| OptFSArchitecture=ResNet502026.01 | 93.13 | 35.31 | |
| OptFSExternal Text=false, Method Category=Vision Model based Methods, Backbone=ResNet-502026.04 | 93.13 | 35.31 | |
| VOSEvaluation Protocol=fine-tuned2023.03 | 92.91 | 29.54 | |
| KNNEvaluation Protocol=fine-tuned2023.03 | 92.87 | 26.72 | |
| DICE + ReActBackbone=MobileNet2023.08 | 92.86 | 31.22 | |
| KNNIn-distribution image requirement=Required2024.09 | 92.67 | 35.62 |