Vision-language alignment on CIFAR-100
88AccuracyGADL
Evaluation Results
| Method | Links | |
|---|---|---|
| GADLVision Family=DeiT, Vision Backbone=DeiT-B/16@384, Language Model=All-Roberta-large-v12025.09 | 88 | |
| GADLVision Family=CLIP, Vision Backbone=ViT-L/14, Language Model=All-Roberta-large-v12025.09 | 85.67 | |
| GADLVision Family=DeiT, Vision Backbone=DeiT-B/16, Language Model=All-Roberta-large-v12025.09 | 84 | |
| GADLVision Family=CLIP, Vision Backbone=ViT-L/14@336, Language Model=All-Roberta-large-v12025.09 | 81 | |
| GADLVision Family=CLIP, Vision Backbone=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 79.67 | |
| GADLVision Family=DINOv2, Vision Backbone=ViT-L/14, Language Model=all-mpnet-base-v22025.09 | 79.67 | |
| GADLVision Family=CLIP, Vision Backbone=RN50x64, Language Model=All-Roberta-large-v12025.09 | 76.33 | |
| GADLVision Family=DINOv2, Vision Backbone=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 67.67 | |
| GADLVision Family=CLIP, Vision Backbone=RN50x16, Language Model=All-Roberta-large-v12025.09 | 67 | |
| GADLVision Family=DINOv2, Vision Backbone=ViT-L/14, Language Model=All-Roberta-large-v12025.09 | 60.67 | |
| GADLVision Family=DeiT, Vision Backbone=DeiT-B/16d, Language Model=All-Roberta-large-v12025.09 | 58.67 | |
| GADLVision Family=DeiT, Vision Backbone=DeiT-B/16d, Language Model=all-mpnet-base-v22025.09 | 58.33 | |
| GADLVision Family=DINOv2, Vision Backbone=ViT-S/14, Language Model=All-Roberta-large-v12025.09 | 58.33 | |
| GADLVision Family=DINOv2, Vision Backbone=ViT-G/14, Language Model=All-Roberta-large-v12025.09 | 58.33 | |
| GADLVision Family=DINOv2, Vision Backbone=ViT-B/14, Language Model=All-Roberta-large-v12025.09 | 55 | |
| GADLVision Family=DeiT, Vision Backbone=DeiT-B/16@384, Language Model=all-mpnet-base-v22025.09 | 54.67 | |
| GADLVision Family=DINOv2, Vision Backbone=ViT-S/14, Language Model=all-mpnet-base-v22025.09 | 48.67 | |
| GADLVision Family=CLIP, Vision Backbone=RN50x64, Language Model=all-mpnet-base-v22025.09 | 48.33 | |
| GADLVision Family=DINOv2, Vision Backbone=ViT-B/14, Language Model=all-mpnet-base-v22025.09 | 48.33 | |
| GADLVision Family=DeiT, Vision Backbone=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 47.33 | |
| GADLVision Family=DeiT, Vision Backbone=DeiT-B/16, Language Model=all-mpnet-base-v22025.09 | 47 | |
| GADLVision Family=CLIP, Vision Backbone=RN50x16, Language Model=all-mpnet-base-v22025.09 | 46.67 | |
| GADLVision Family=CLIP, Vision Backbone=ViT-L/14, Language Model=all-mpnet-base-v22025.09 | 46 | |
| GADLVision Family=DeiT, Vision Backbone=DeiT-B/16d@384, Language Model=All-Roberta-large-v12025.09 | 42.67 | |
| LocalCKAVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 24 | |
| LocalCKAVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 23.33 | |
| GADLVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 20.8 | |
| GADLVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 19.6 | |
| GADLVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 16.8 | |
| GADLVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 14.2 | |
| LocalCKAVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 13.67 | |
| GADLVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 13.4 | |
| GADLVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 10.8 | |
| LocalCKAVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 10.33 | |
| Hahn-GrantVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 5.33 | |
| LocalCKAVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 4.67 | |
| FAQVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 4.33 | |
| FAQVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 4.33 | |
| LocalCKAVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 4 | |
| Hahn-GrantVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 4 | |
| GurobiVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 3.67 | |
| GurobiVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 3.44 | |
| FAQVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 3.33 | |
| GurobiVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 3.11 | |
| Hahn-GrantVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 3 | |
| FAQVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 2.67 | |
| MPOptVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 2.67 | |
| GurobiVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 2.56 | |
| FAQVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 2.33 | |
| Hahn-GrantVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 2.33 | |
| OTVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 2.33 | |
| GurobiVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 2.11 | |
| Hahn-GrantVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 2 | |
| GurobiVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 1.78 | |
| MPOptVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 1.67 | |
| OTVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 1.67 | |
| OTVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 1.67 | |
| Hahn-GrantVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 1.33 | |
| FAQVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 1.33 | |
| MPOptVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 1.33 | |
| OTVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 1 | |
| OTVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 1 | |
| OTVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 1 | |
| MPOptVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 0.67 | |
| MPOptVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 0.33 | |
| MPOptVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 0.33 |