Image Classification on KITTI
86.4AccuracyMultiple models
Evaluation Results
| Method | Links | |
|---|---|---|
| Multiple modelsBackbone=ViT-L/142022.08 | 86.4 | |
| Joint patchingBackbone=ViT-L/142022.08 | 85.1 | |
| Multiple modelsBackbone=ViT-B/162022.08 | 84.8 | |
| Joint patchingBackbone=ViT-B/162022.08 | 80.5 | |
| Multiple modelsBackbone=ViT-B/322022.08 | 77.9 | |
| Joint patchingBackbone=ViT-B/322022.08 | 76.2 | |
| Seq. patchingBackbone=ViT-L/14, Seed=22022.08 | 75.4 | |
| Seq. patchingBackbone=ViT-L/14, Seed=02022.08 | 71.2 | |
| CLIPLinear probing=true, Backbone=ViT-B/16, Pre-train=IT35M2022.10 | 69.7 | |
| xCLIPLinear probing=true, Backbone=ViT-B/16, Pre-train=IT35M2022.10 | 69.3 | |
| Seq. patchingBackbone=ViT-L/14, Seed=12022.08 | 67.4 | |
| Seq. patchingBackbone=ViT-B/16, Seed=22022.08 | 64.4 | |
| Seq. patchingBackbone=ViT-B/16, Seed=02022.08 | 64.1 | |
| nCLIPLinear probing=true, Backbone=ViT-B/16, Pre-train=IT35M2022.10 | 64 | |
| Seq. patchingBackbone=ViT-B/32, Seed=02022.08 | 63.3 | |
| Seq. patchingBackbone=ViT-B/16, Seed=12022.08 | 59.6 | |
| Seq. patchingBackbone=ViT-B/32, Seed=12022.08 | 58.1 | |
| Seq. patchingBackbone=ViT-B/32, Seed=22022.08 | 57 | |
| Parallel patchingBackbone=ViT-L/142022.08 | 49.6 | |
| Parallel patchingBackbone=ViT-B/162022.08 | 48 | |
| CLIPPre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 42.9 | |
| Parallel patchingBackbone=ViT-B/322022.08 | 42.1 | |
| CLIP+Pre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 41.9 | |
| xCLIPBackbone=ViT-B/16, Pre-trained on=IT35M, Mode=Zero-shot2022.10 | 39.8 | |
| nCLIPBackbone=ViT-B/16, Pre-trained on=IT35M, Mode=Zero-shot2022.10 | 35.4 | |
| FLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 34.8 | |
| MLCDPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 34.5 | |
| UNICOMPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 33.4 | |
| OpenCLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 32.5 | |
| CLIP-MaptinyImage Encoder=ViT-0.8M/16, Zero-shot=true2026.02 | 32.5 | |
| CLIPBackbone=ViT-B/16, Pre-trained on=IT35M, Mode=Zero-shot2022.10 | 31.6 | |
| CLIPImage Encoder=ViT-B/16, Zero-shot=true2026.02 | 31.5 | |
| UnpatchedBackbone=ViT-B/162022.08 | 30.5 | |
| OpenCLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 29.3 | |
| MLCDPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 28.7 | |
| †TinyCLIPImage Encoder=ViT-0.8M/16, Zero-shot=true2026.02 | 28 | |
| CLIPPre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 26.9 | |
| UnpatchedBackbone=ViT-L/142022.08 | 26 | |
| CLIP (reported)Pre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 23.1 | |
| UnpatchedBackbone=ViT-B/322022.08 | 22.6 | |
| OpenCLIPImage Encoder=ViT-B/16, Zero-shot=true2026.02 | 17 | |
| †TinyCLIPImage Encoder=ViT-8M/16, Zero-shot=true2026.02 | 15.3 | |
| CLIP-MapsmallImage Encoder=ViT-8M/16, Zero-shot=true2026.02 | 13.2 | |
| TinyCLIPImage Encoder=ViT-39M/16, Zero-shot=true2026.02 | 11.1 | |
| CLIP-MapbaseImage Encoder=ViT-39M/16, Zero-shot=true2026.02 | 10.3 |