Vision-language alignment on CINIC-10
100AccuracyGADL
Evaluation Results
| Method | Links | |
|---|---|---|
| GADLVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 100 | |
| GurobiVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 100 | |
| Hahn-GrantVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 100 | |
| GurobiVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 80 | |
| Hahn-GrantVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 80 | |
| GADLVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 80 | |
| MPOptVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 79 | |
| GurobiVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 79 | |
| Hahn-GrantVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 79 | |
| OTVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 77.5 | |
| LocalCKAVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 68 | |
| GADLVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 60 | |
| LocalCKAVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 57 | |
| GADLVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 56.7 | |
| FAQVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 55.5 | |
| LocalCKAVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 52.5 | |
| GurobiVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 50 | |
| Hahn-GrantVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 50 | |
| OTVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 49.5 | |
| MPOptVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 47 | |
| GADLVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 46 | |
| GADLVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 42 | |
| GurobiVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 40 | |
| Hahn-GrantVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 40 | |
| FAQVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-mpnet-base-v22025.09 | 31 | |
| FAQVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 30.5 | |
| LocalCKAVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 30 | |
| FAQVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 29.5 | |
| OTVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 20 | |
| OTVision Model=DINOv2, Vision Model Architecture=ViT-G/14, Language Model=all-roberta-large-v12025.09 | 15.5 | |
| GurobiVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 10 | |
| Hahn-GrantVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 10 | |
| LocalCKAVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 4 | |
| OTVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 2 | |
| MPOptVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-mpnet-base-v22025.09 | 0 | |
| FAQVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 0 | |
| MPOptVision Model=CLIP, Vision Model Architecture=ViT-L/14@336, Language Model=all-roberta-large-v12025.09 | 0 | |
| MPOptVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-mpnet-base-v22025.09 | 0 | |
| LocalCKAVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 0 | |
| OTVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 0 | |
| FAQVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 0 | |
| MPOptVision Model=DeiT, Vision Model Architecture=DeiT-B/16d@384, Language Model=all-roberta-large-v12025.09 | 0 |