Out-of-Distribution Detection on ImageNet-1k (ID) vs Places (OOD)
97.37AUROCSynOOD
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SynOODTraining Protocol=Training-required (or with Fine-tuning), Encoder=ViT-B/162025.09 | 97.37 | 12.12 | |
| ANTSTraining Protocol=Zero Shot (No Training Required), Encoder=ViT-B/162025.09 | 96.1 | 20.21 | |
| InterNegArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=no training on ID or extra data2026.03 | 95.01 | 27.11 | |
| AdaNegArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=no training on ID or extra data2026.03 | 94.55 | 34.34 | |
| AdaNegTraining Protocol=Zero Shot (No Training Required), Encoder=ViT-B/162025.09 | 94.55 | 34.34 | |
| SUPREMEArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=requiring training on ID or extra data2026.03 | 93.56 | 26.69 | |
| CLIPScopeArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=no training on ID or extra data2026.03 | 93.54 | 28.45 | |
| NegPromptArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=requiring training on ID or extra data2026.03 | 93.34 | 27.6 | |
| CMATraining Protocol=Training-required (or with Fine-tuning), Encoder=ViT-B/162025.09 | 93.11 | 27.65 | |
| EOEArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=no training on ID or extra data2026.03 | 92.95 | 30.16 | |
| EOETraining Protocol=Zero Shot (No Training Required), Encoder=ViT-B/162025.09 | 92.95 | 30.16 | |
| CSPArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=no training on ID or extra data2026.03 | 92.9 | 29.32 | |
| CSPTraining Protocol=Zero Shot (No Training Required), Encoder=ViT-B/162025.09 | 92.9 | 29.32 | |
| Local-PromptArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=requiring training on ID or extra data2026.03 | 92.42 | 31.74 | |
| CLIPNArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=requiring training on ID or extra data2026.03 | 92.28 | 33.45 | |
| CLIPNTraining Protocol=Training-required (or with Fine-tuning), Encoder=ViT-B/162025.09 | 92.28 | 33.45 | |
| SCTTraining Protocol=Training-required (or with Fine-tuning), Encoder=ViT-B/162025.09 | 92.24 | 29.86 | |
| X-MahalanobisBackbone=ViT-B/16, Pre-training=ImageNet-21K, Evaluation Protocol=Fine-tuning2026.06 | 92.04 | 37.78 | |
| LAPTArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=requiring training on ID or extra data2026.03 | 92.01 | 33.01 | |
| LAPTTraining Protocol=Training-required (or with Fine-tuning), Encoder=ViT-B/162025.09 | 92.01 | 33.01 | |
| LoCoOpArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=requiring training on ID or extra data2026.03 | 91.98 | 32.87 | |
| NegLabelArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=no training on ID or extra data2026.03 | 91.64 | 35.59 | |
| NegLabelTraining Protocol=Zero Shot (No Training Required), Encoder=ViT-B/162025.09 | 91.64 | 35.59 | |
| EnergyArchitecture=CLIP ViT-B/16, Modality=Visual-based, Training Requirement=requiring training on ID or extra data2026.03 | 91.41 | 39.87 | |
| LSNArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=requiring training on ID or extra data2026.03 | 91.25 | 34.48 | |
| LSNTraining Protocol=Training-required (or with Fine-tuning), Encoder=ViT-B/162025.09 | 91.25 | 34.48 | |
| VOSArchitecture=CLIP ViT-B/16, Modality=Visual-based, Training Requirement=requiring training on ID or extra data2026.03 | 91.23 | 38.39 | |
| NegPromptTraining Protocol=Training-required (or with Fine-tuning), Encoder=ViT-B/162025.09 | 91.16 | 35.52 | |
| KNNArchitecture=CLIP ViT-B/16, Modality=Visual-based, Training Requirement=requiring training on ID or extra data2026.03 | 91.02 | 39.61 | |
| ID-LikeArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=requiring training on ID or extra data2026.03 | 90.57 | 44 | |
| ID-LikeTraining Protocol=Training-required (or with Fine-tuning), Encoder=ViT-B/162025.09 | 90.57 | 44 | |
| LoCoOpTraining Protocol=Training-required (or with Fine-tuning), Encoder=ViT-B/162025.09 | 90.54 | 44.15 | |
| MCMArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=no training on ID or extra data2026.03 | 90.31 | 46.2 | |
| MCMTraining Protocol=Zero Shot (No Training Required), Encoder=ViT-B/162025.09 | 90.31 | 46.2 | |
| CoVerArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=no training on ID or extra data2026.03 | 90.27 | 40.71 | |
| CoVerTraining Protocol=Zero Shot (No Training Required), Encoder=ViT-B/162025.09 | 90.27 | 40.71 | |
| OODDTraining Protocol=Zero Shot (No Training Required), Encoder=ViT-B/162025.09 | 87.1 | 44.76 | |
| MM++Backbone=ViT-B/16, Pre-training=ImageNet-21K, Evaluation Protocol=Post-hoc, K=22026.06 | 87.05 | 55.58 | |
| Relative Mahalanobis++Backbone=ViT-B/16, Pre-training=ImageNet-21K, Evaluation Protocol=Post-hoc2026.06 | 85.77 | 64.32 | |
| Mahalanobis++Backbone=ViT-B/16, Pre-training=ImageNet-21K, Evaluation Protocol=Post-hoc2026.06 | 85.75 | 64.11 | |
| ODINArchitecture=CLIP ViT-B/16, Modality=Visual-based, Training Requirement=requiring training on ID or extra data2026.03 | 85.54 | 55.06 | |
| Relative MahalanobisBackbone=ViT-B/16, Pre-training=ImageNet-21K, Evaluation Protocol=Post-hoc2026.06 | 85.28 | 63.09 | |
| KNNBackbone=ViT-B/16, Pre-training=ImageNet-21K, Evaluation Protocol=Post-hoc2026.06 | 85.15 | 61.54 | |
| MahalanobisBackbone=ViT-B/16, Pre-training=ImageNet-21K, Evaluation Protocol=Post-hoc2026.06 | 84.57 | 64.58 | |
| ViMArchitecture=CLIP ViT-B/16, Modality=Visual-based, Training Requirement=requiring training on ID or extra data2026.03 | 83.75 | 60.67 | |
| ZOCArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=requiring training on ID or extra data2026.03 | 83.39 | 73.06 | |
| ZOCTraining Protocol=Training-required (or with Fine-tuning), Encoder=ViT-B/162025.09 | 83.39 | 73.06 | |
| EnergyArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=no training on ID or extra data2026.03 | 83.38 | 75.08 | |
| MSPBackbone=ViT-B/16, Pre-training=ImageNet-21K, Evaluation Protocol=Post-hoc2026.06 | 80.44 | 65.9 | |
| MSPArchitecture=CLIP ViT-B/16, Modality=Visual-based, Training Requirement=requiring training on ID or extra data2026.03 | 79.67 | 74.41 | |
| MSPTraining Protocol=Training-required (or with Fine-tuning), Encoder=ViT-B/162025.09 | 79.67 | 74.41 | |
| ReActBackbone=ViT-B/16, Pre-training=ImageNet-21K, Evaluation Protocol=Post-hoc2026.06 | 78.37 | 61.87 | |
| GradNormArchitecture=CLIP ViT-B/16, Modality=Visual-based, Training Requirement=requiring training on ID or extra data2026.03 | 73.7 | 80.41 | |
| EnergyBackbone=ViT-B/16, Pre-training=ImageNet-21K, Evaluation Protocol=Post-hoc2026.06 | 73.16 | 68.95 | |
| ODINBackbone=ViT-B/16, Pre-training=ImageNet-21K, Evaluation Protocol=Post-hoc2026.06 | 69.69 | 75.09 | |
| MahalanobisArchitecture=CLIP ViT-B/16, Modality=VLM-based, Training Requirement=no training on ID or extra data2026.03 | 65.96 | 98.54 |