Vision Model Representation Alignment on ImageNet 20% held-out split of 20,000 samples (val)
85Reconstruction AccuracyMOT + R
Evaluation Results
| Method | Links | |
|---|---|---|
| MOT + RModel 1=ViT-MAE Base, Model 2=ViT-MAE Large2025.10 | 85 | |
| MOT + RModel 1=DINOv2 Small, Model 2=DINOv2 Giant2025.10 | 79 | |
| MOT + RModel 1=ViT-MAE Base, Model 2=ViT-MAE Huge2025.10 | 78.8 | |
| MOT + RModel 1=DINOv2 Small, Model 2=DINOv2 Large2025.10 | 77.8 | |
| MOT + RModel 1=ViT-MAE Base, Model 2=DINOv2 Large2025.10 | 73.2 | |
| MOT + RModel 1=DINOv2 Small, Model 2=ViT-MAE Huge2025.10 | 65.7 | |
| MOT + RModel 1=DINOv2 Small, Model 2=ViT-MAE Large2025.10 | 63.3 | |
| Pairwise Best OTModel 1=ViT-MAE Base, Model 2=DINOv2 Large2025.10 | 62.4 | |
| MOT + RModel 1=ViT-MAE Huge, Model 2=DINOv2 Giant2025.10 | 61.4 | |
| MOT + RModel 1=DINOv2 Small, Model 2=ViT-MAE Base2025.10 | 60 | |
| Pairwise Best OTModel 1=ViT-MAE Base, Model 2=ViT-MAE Large2025.10 | 59.8 | |
| Pairwise Best + RModel 1=ViT-MAE Base, Model 2=ViT-MAE Large2025.10 | 59.6 | |
| MOTModel 1=ViT-MAE Base, Model 2=ViT-MAE Large2025.10 | 58.8 | |
| MOT + RModel 1=ViT-MAE Base, Model 2=DINOv2 Giant2025.10 | 58 | |
| MOTModel 1=ViT-MAE Base, Model 2=DINOv2 Large2025.10 | 57.7 | |
| Pairwise Best + RModel 1=ViT-MAE Base, Model 2=ViT-MAE Huge2025.10 | 57.1 | |
| Pairwise Best + RModel 1=DINOv2 Small, Model 2=ViT-MAE Base2025.10 | 52.6 | |
| Pairwise Best + RModel 1=DINOv2 Small, Model 2=ViT-MAE Large2025.10 | 50.9 | |
| Pairwise Best + RModel 1=DINOv2 Small, Model 2=ViT-MAE Huge2025.10 | 50.8 | |
| MOTModel 1=DINOv2 Small, Model 2=DINOv2 Giant2025.10 | 46.6 | |
| Pairwise Best OTModel 1=DINOv2 Small, Model 2=DINOv2 Giant2025.10 | 43.3 | |
| Pairwise Best + RModel 1=DINOv2 Small, Model 2=DINOv2 Giant2025.10 | 41.8 | |
| Pairwise Best OTModel 1=ViT-MAE Base, Model 2=ViT-MAE Huge2025.10 | 41.7 | |
| MOTModel 1=DINOv2 Small, Model 2=ViT-MAE Huge2025.10 | 41.1 | |
| Pairwise Best + RModel 1=DINOv2 Small, Model 2=DINOv2 Large2025.10 | 39.4 | |
| Pairwise Best OTModel 1=DINOv2 Small, Model 2=ViT-MAE Huge2025.10 | 38.6 | |
| MOTModel 1=DINOv2 Small, Model 2=ViT-MAE Large2025.10 | 38.1 | |
| Pairwise Best + RModel 1=ViT-MAE Huge, Model 2=DINOv2 Giant2025.10 | 35.9 | |
| Pairwise Best OTModel 1=DINOv2 Small, Model 2=ViT-MAE Large2025.10 | 35.4 | |
| MOTModel 1=DINOv2 Small, Model 2=DINOv2 Large2025.10 | 35.3 | |
| Pairwise Best OTModel 1=ViT-MAE Huge, Model 2=DINOv2 Giant2025.10 | 35.2 | |
| Pairwise Best OTModel 1=DINOv2 Small, Model 2=DINOv2 Large2025.10 | 34 | |
| MOTModel 1=ViT-MAE Huge, Model 2=DINOv2 Giant2025.10 | 31.7 | |
| Pairwise Best OTModel 1=DINOv2 Small, Model 2=ViT-MAE Base2025.10 | 30.1 | |
| Pairwise Best + RModel 1=ViT-MAE Base, Model 2=DINOv2 Giant2025.10 | 29.3 | |
| MOTModel 1=DINOv2 Small, Model 2=ViT-MAE Base2025.10 | 28.9 | |
| Pairwise Best + RModel 1=ViT-MAE Base, Model 2=DINOv2 Large2025.10 | 28.3 | |
| MOTModel 1=ViT-MAE Base, Model 2=DINOv2 Giant2025.10 | 20.2 | |
| Pairwise Best OTModel 1=ViT-MAE Base, Model 2=DINOv2 Giant2025.10 | 18 | |
| MOTModel 1=ViT-MAE Base, Model 2=ViT-MAE Huge2025.10 | 14.9 |