Vision-language alignment on CIFAR-10 (Accuracy)
100AccuracyGADL
Evaluation Results
| Method | Links | |
|---|---|---|
| GADLVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 100 | |
| GurobiVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 100 | |
| Hahn-GrantVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 100 | |
| GADLVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 100 | |
| MPOptVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 94 | |
| MPOptVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 73.5 | |
| GurobiVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 69.5 | |
| Hahn-GrantVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 69.5 | |
| GurobiVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 59 | |
| Hahn-GrantVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 59 | |
| GADLVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 52 | |
| GADLVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 48 | |
| GurobiVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 47 | |
| Hahn-GrantVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 47 | |
| GADLVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 44 | |
| FAQVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 40 | |
| FAQVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 38 | |
| LocalCKAVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 37.5 | |
| FAQVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 37.5 | |
| OTVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 33.5 | |
| GADLVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 32 | |
| OTVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 30 | |
| GurobiVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 28.5 | |
| Hahn-GrantVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 28.5 | |
| LocalCKAVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 25 | |
| Hahn-GrantVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 25 | |
| LocalCKAVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 24 | |
| FAQVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 22.5 | |
| GurobiVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 20.5 | |
| LocalCKAVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 20 | |
| LocalCKAVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 18.5 | |
| LocalCKAVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 17 | |
| FAQVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 12 | |
| OTVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 12 | |
| OTVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 10 | |
| OTVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 10 | |
| FAQVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 0.5 | |
| OTVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 0 | |
| MPOptVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 0 | |
| MPOptVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 0 | |
| MPOptVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 0 | |
| MPOptVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 0 |