Image Classification on ImageNet 256x256 (val)
86.3Top-1 AccDinov2-L
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Dinov2-LType=Continuous, Ratio=-, Training Data=LVD142M, linear probing=true2026.05 | 86.3 | — | |
| SigLIP2-So/16Type=Continuous, Ratio=-, Training Data=WebLI10B2026.05 | 83.4 | — | |
| WinTokType=Hybrid, Ratio=16, Training Data=Mix50M, Codebook Size=4096 x 4, Capacity=2^{48}2026.05 | 82 | — | |
| DualTokenType=Discrete, Ratio=16, Training Data=CC12M2026.05 | 81.6 | — | |
| Original ImagesDescription=Original validation set images2026.05 | 80.35 | 95.12 | |
| TokLIP-LType=Discrete, Ratio=16, Training Data=Mix80M, Codebook Size=16384, Capacity=2^{14}2026.05 | 80 | — | |
| RAE (SigLIP2)Type=Continuous, Ratio=16, Training Data=IN-1K, linear probing=true2026.05 | 79.1 | — | |
| QLIP-LType=Discrete, Ratio=16, Training Data=DC1B2026.05 | 79.1 | — | |
| DC-AE ReconMode=Autoencoder reconstruction2026.05 | 77.3 | 93.67 | |
| DC-AE Proj ReconMode=Images reconstructed from hyperspherically projected latents2026.05 | 76.29 | 92.97 | |
| CLIP-L/14Type=Continuous, Ratio=-, Training Data=WIT400M2026.05 | 75.5 | — | |
| SeTok#Tokens=Dynamic2024.06 | 75.4 | — | |
| VILA-UType=Discrete, Ratio=16, Training Data=CY700M, Codebook Size=16384, Capacity=2^{14}2026.05 | 73.3 | — | |
| TiTok#Tokens=Fixed, Latent size=32 x 12024.06 | 72.6 | — | |
| UniTokType=Discrete, Ratio=16, Training Data=DC1B, Codebook Size=4096 x 8, Capacity=2^{96}2026.05 | 70.8 | — | |
| VFMTokType=Discrete, Ratio=-, Training Data=IN-1K, Codebook Size=16384, Capacity=2^{14}, linear probing=true2026.05 | 69.4 | — |