Image Classification on ImageNet-O
51.34AccuracyNAMEx-Full-Mom
Evaluation Results
| Method | Links | |
|---|---|---|
| NAMEx-Full-MomParams=50M, Momentum=true, Zero-shot=true2025.10 | 51.34 | |
| NAMEx-MomParams=50M, Momentum=true, Zero-shot=true2025.10 | 51.22 | |
| TuneCLIPBase Model=OpenAI ViT-B/322026.01 | 51.11 | |
| TuneCLIPBase Model=LAION ViT-B/322026.01 | 50.85 | |
| CAMExParams=50M, Zero-shot=true2025.10 | 50.69 | |
| NAMEx-FullParams=50M, Momentum=false, Zero-shot=true2025.10 | 50.66 | |
| OpenCLIPBase Model=LAION ViT-B/322026.01 | 50.4 | |
| EP-CAMEx-MomParams=50M, Momentum=true, Zero-shot=true2025.10 | 50.37 | |
| NAMExParams=50M, Momentum=false, Zero-shot=true2025.10 | 50.3 | |
| EP-CAMExParams=50M, Momentum=false, Zero-shot=true2025.10 | 50.27 | |
| BaselineBase Model=LAION ViT-B/322026.01 | 49.95 | |
| OpenCLIPBase Model=OpenAI ViT-B/322026.01 | 48.85 | |
| FastCLIPBase Model=LAION ViT-B/322026.01 | 48 | |
| BaselineBase Model=OpenAI ViT-B/322026.01 | 47.75 | |
| FastCLIPBase Model=OpenAI ViT-B/322026.01 | 47.2 | |
| TuneCLIPBase Model=OpenAI ViT-B/162026.01 | 46.65 | |
| OpenCLIPBase Model=OpenAI ViT-B/162026.01 | 44.05 | |
| MulCLIPBackbone=ViT-B/16, Fine-tuning dataset=DOCCI, Evaluation Protocol=zero-shot2025.12 | 43.8 | |
| SMEARParams=50M, Zero-shot=true2025.10 | 43.35 | |
| SMoEParams=50M, Zero-shot=true2025.10 | 43.34 | |
| FastCLIPBase Model=OpenAI ViT-B/162026.01 | 43.3 | |
| BaselineBase Model=OpenAI ViT-B/162026.01 | 42.3 | |
| GOALBackbone=ViT-B/16, Fine-tuning dataset=DOCCI, Evaluation Protocol=zero-shot2025.12 | 42.15 | |
| MulCLIPBackbone=ViT-B/16, Fine-tuning dataset=DCI, Evaluation Protocol=zero-shot2025.12 | 41.95 | |
| TuneCLIPBase Model=SigLIP ViT-B/162026.01 | 41.5 | |
| GOALBackbone=ViT-B/16, Fine-tuning dataset=DCI, Evaluation Protocol=zero-shot2025.12 | 40.85 | |
| OpenCLIPBase Model=SigLIP ViT-B/162026.01 | 39.5 | |
| BaselineBase Model=SigLIP ViT-B/162026.01 | 38.15 | |
| MulCLIPBackbone=ViT-L/14, Fine-tuning dataset=DOCCI, Evaluation Protocol=zero-shot2025.12 | 36.95 | |
| FastCLIPBase Model=SigLIP ViT-B/162026.01 | 35.85 | |
| MulCLIPBackbone=ViT-L/14, Fine-tuning dataset=DCI, Evaluation Protocol=zero-shot2025.12 | 34 | |
| GOALBackbone=ViT-L/14, Fine-tuning dataset=DOCCI, Evaluation Protocol=zero-shot2025.12 | 33.9 | |
| GOALBackbone=ViT-L/14, Fine-tuning dataset=DCI, Evaluation Protocol=zero-shot2025.12 | 32.5 |