Vision-language alignment on ImageNet-100 (Accuracy)
83.67AccuracyGADL
Evaluation Results
| Method | Links | |
|---|---|---|
| GADLVision Family=DINOv2, Vision Backbone=ViT-B/14, Language Model=all-mpnet-base-v22025.09 | 83.67 | |
| GADLVision Family=CLIP, Vision Backbone=ViT-L/14, Language Model=all-mpnet-base-v22025.09 | 74 | |
| GADLVision Family=DINOv2, Vision Backbone=ViT-L/14, Language Model=All-Roberta-large-v12025.09 | 69.67 | |
| GADLVision Family=DeiT, Vision Backbone=DeiT-B/16, Language Model=all-mpnet-base-v22025.09 | 67.33 | |
| GADLVision Family=DeiT, Vision Backbone=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 67.33 | |
| GADLVision Family=DeiT, Vision Backbone=DeiT-B/16d@384, Language Model=All-Roberta-large-v12025.09 | 65.67 | |
| GADLVision Family=CLIP, Vision Backbone=RN50x16, Language Model=All-Roberta-large-v12025.09 | 63.67 | |
| GADLVision Family=DINOv2, Vision Backbone=ViT-S/14, Language Model=All-Roberta-large-v12025.09 | 63.67 | |
| GADLVision Family=CLIP, Vision Backbone=ViT-L/14, Language Model=All-Roberta-large-v12025.09 | 61 | |
| GADLVision Family=DINOv2, Vision Backbone=ViT-B/14, Language Model=All-Roberta-large-v12025.09 | 60.33 | |
| GADLVision Family=DeiT, Vision Backbone=DeiT-B/16, Language Model=All-Roberta-large-v12025.09 | 58.67 | |
| GADLVision Family=CLIP, Vision Backbone=RN50x64, Language Model=All-Roberta-large-v12025.09 | 58 | |
| GADLVision Family=DeiT, Vision Backbone=DeiT-B/16@384, Language Model=All-Roberta-large-v12025.09 | 57.67 | |
| GADLVision Family=DeiT, Vision Backbone=DeiT-B/16d, Language Model=All-Roberta-large-v12025.09 | 54.33 | |
| GADLVision Family=DINOv2, Vision Backbone=ViT-G/14, Language Model=All-Roberta-large-v12025.09 | 49.33 | |
| GADLVision Family=DINOv2, Vision Backbone=ViT-L/14, Language Model=all-mpnet-base-v22025.09 | 48.33 | |
| GADLVision Family=CLIP, Vision Backbone=ViT-L/14@336, Language Model=All-Roberta-large-v12025.09 | 45.33 | |
| GADLVision Family=DINOv2, Vision Backbone=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 44.33 | |
| GADLVision Family=CLIP, Vision Backbone=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 41.33 | |
| GADLVision Family=CLIP, Vision Backbone=RN50x16, Language Model=all-mpnet-base-v22025.09 | 40.67 | |
| GADLVision Family=DeiT, Vision Backbone=DeiT-B/16d, Language Model=all-mpnet-base-v22025.09 | 38.33 | |
| GADLVision Family=CLIP, Vision Backbone=RN50x64, Language Model=all-mpnet-base-v22025.09 | 37.33 | |
| GADLVision Family=DINOv2, Vision Backbone=ViT-S/14, Language Model=all-mpnet-base-v22025.09 | 35.67 | |
| GADLVision Family=DeiT, Vision Backbone=DeiT-B/16@384, Language Model=all-mpnet-base-v22025.09 | 35.33 | |
| GADLVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 20.2 | |
| GADLVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 19.6 | |
| GADLVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 13 | |
| GADLVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 10.4 | |
| LocalCKAVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 9.33 | |
| GADLVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 8.8 | |
| LocalCKAVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 8.33 | |
| LocalCKAVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 8.33 | |
| LocalCKAVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 8 | |
| Hahn-GrantVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 6.33 | |
| LocalCKAVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 6 | |
| GADLVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 5.8 | |
| LocalCKAVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 5.33 | |
| Hahn-GrantVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 4.93 | |
| MPOptVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 4.67 | |
| Hahn-GrantVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 4.67 | |
| GurobiVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 4.5 | |
| FAQVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 4.33 | |
| FAQVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 4.33 | |
| MPOptVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 4 | |
| FAQVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 3.67 | |
| GurobiVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 3.56 | |
| FAQVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 3.33 | |
| GurobiVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 3.22 | |
| GurobiVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 3 | |
| FAQVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 3 | |
| MPOptVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 2.67 | |
| MPOptVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 2.67 | |
| GurobiVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 2.5 | |
| FAQVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 2.33 | |
| OTVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 2 | |
| Hahn-GrantVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 1.67 | |
| GurobiVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 1.5 | |
| OTVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 1.33 | |
| Hahn-GrantVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 1.33 | |
| Hahn-GrantVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 1.22 | |
| OTVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 1 | |
| MPOptVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 1 | |
| OTVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 1 | |
| OTVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 0.67 | |
| MPOptVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 0.67 | |
| OTVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 0.33 |