Image Reconstruction on ImageNet1K (val)
0.25FIDDualToken
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| DualTokenPre-trained Backbone=SigLIP-So/14-3842025.03 | 0.25 | — | — | 28.69 | 0.744 | |
| VA-VAEParams=70M, GFlops=3102025.12 | 0.28 | — | — | 26.3 | — | |
| UniTokResolution=256, Code Shape=16×16, Codebook Size=65,536, Category=Unified Tokenizer, trained_on_billion_scale_datasets=true2026.03 | 0.33 | — | — | — | — | |
| UniTok2025.03 | 0.38 | — | — | 25.34 | — | |
| UniTokRatio=16, Resolution=256x2562026.05 | 0.41 | — | — | 24.31 | 0.71 | |
| WinTokRatio=16, Resolution=256x2562026.05 | 0.41 | — | — | 24.23 | 0.71 | |
| EvoTokResolution=256, Code Shape=16×16×4, Codebook Size=131,072, Category=Unified Tokenizer2026.03 | 0.43 | — | — | — | — | |
| MAETokParams=176M, GFlops=54.22025.12 | 0.48 | — | — | 23.61 | — | |
| RecTokParams=176M, GFlops=44.42025.12 | 0.48 | — | — | 26.16 | — | |
| DeTokParams=176M, GFlops=44.42025.12 | 0.52 | — | — | 23.53 | — | |
| DualTokenResolution=256, Code Shape=16×16×4, Category=Unified Tokenizer2026.03 | 0.52 | — | — | — | — | |
| DualTokenPre-trained Backbone=SigLIP2-So/16-2562025.03 | 0.52 | — | — | 28.03 | 0.726 | |
| RAEParams=395M, GFlops=128.92025.12 | 0.57 | — | — | 18.98 | — | |
| SD-VAEParams=84M, GFlops=4452025.12 | 0.62 | — | — | 26.04 | — | |
| TokenFlow-LResolution=256, Code Shape=680, Codebook Size=32,768, Category=Unified Tokenizer, trained_on_billion_scale_datasets=true2026.03 | 0.63 | — | — | — | — | |
| TokenFlowResolution=384px2025.03 | 0.63 | — | — | 22.77 | 0.731 | |
| SBER-MoVQGAN2025.03 | 0.68 | — | — | 27.04 | 0.741 | |
| LCDM+LC+DCDDBackbone=Janus-Pro 7B, Resolution=384 × 3842026.03 | 0.7535 | — | 0.1374 | — | 0.5957 | |
| ImageFolderToken Length=572 (286×2), #Code=4,0962025.12 | 0.8 | — | — | — | — | |
| STATType=1D Tokenizer, #Tokens=240, Codebook Size=4096, Resolution=256x256, Probability threshold=0.01, Extra tokens=102026.01 | 0.88 | — | — | 20.02 | — | |
| TokLIPPre-trained Backbone=SigLIP2-So/16-3842025.03 | 0.94 | — | — | 21.94 | 0.726 | |
| STATType=1D Tokenizer, #Tokens=230, Codebook Size=4096, Resolution=256x256, Probability threshold=0.012026.01 | 0.99 | — | — | 20.25 | — | |
| IBQResolution=256, Code Shape=16×16, Codebook Size=252,144, Category=Reconstruction Only2026.03 | 1 | — | — | — | — | |
| AugVAE-MLCodebook Size N=64 × 64 ~ 8 × 8, dz=81922021.11 | 1.04 | — | — | — | — | |
| DualTokenPre-trained Backbone=SigLIP-L/16-2562025.03 | 1.06 | — | — | 27.12 | 0.693 | |
| FlexTokType=1D Tokenizer, #Tokens=256, Codebook Size=64000, Resolution=256x2562026.01 | 1.08 | — | — | 17.7 | — | |
| One-D-Piece-LType=1D Tokenizer, #Tokens=256, Codebook Size=4096, Resolution=256x2562026.01 | 1.08 | — | — | 19.04 | — | |
| Mo-VQGANToken Length=1024 (16×16×4), #Code=1,0242025.12 | 1.12 | — | — | — | — | |
| MoVQGAN2025.03 | 1.12 | — | — | 22.42 | 0.673 | |
| STAT-FixcountType=1D Tokenizer, #Tokens=220, Codebook Size=4096, Resolution=256x2562026.01 | 1.15 | — | — | 20.35 | — | |
| STAT-HarddropType=1D Tokenizer, #Tokens=222, Codebook Size=4096, Resolution=256x2562026.01 | 1.15 | — | — | 20.3 | — | |
| STATType=1D Tokenizer, #Tokens=220, Codebook Size=4096, Resolution=256x2562026.01 | 1.15 | — | — | 20.22 | — | |
| SemHiTokResolution=256, Code Shape=16×16, Codebook Size=196,608, Category=Unified Tokenizer2026.03 | 1.16 | — | — | — | — | |
| Open MAGVIT-v2Type=2D Tokenizer, #Tokens=256, Codebook Size=262144, Resolution=256x2562026.01 | 1.17 | — | — | 22.64 | — | |
| Open-MAGVIT22025.03 | 1.17 | — | — | 21.9 | — | |
| SFTok-LToken Length=64 (1d-tokenizer), #Code=8,1922025.12 | 1.21 | — | — | — | — | |
| VILA-UPre-trained Backbone=SigLIP-So/14-3842025.03 | 1.25 | — | — | — | — | |
| ViT-VQGANLatent Size=32 × 32, dim Z=81922021.10 | 1.28 | — | — | — | — | |
| ViT-VQGANToken Length=1024 (16×16), #Code=8,1922025.12 | 1.28 | — | — | — | — | |
| VQGAN-LC# Tokens=1,024, Codebook Size=100,0002024.06 | 1.29 | 99.5 | 0.07 | 27 | 71.6 | |
| TokenFlow-BResolution=224, Code Shape=680, Codebook Size=32,768, Category=Unified Tokenizer, trained_on_billion_scale_datasets=true2026.03 | 1.37 | — | — | — | — | |
| TokenFlowResolution=256px2025.03 | 1.37 | — | — | 21.41 | 0.687 | |
| TokenFlowRatio=16, Resolution=256x2562026.05 | 1.37 | — | — | 21.41 | 0.69 | |
| DF-VQGAN# Tokens=1,024, Codebook Size=8,1922024.06 | 1.38 | — | — | — | — | |
| LCDM+LC+DCDDBackbone=LlamaGen-XL, Resolution=256x2562026.03 | 1.4087 | — | 0.1404 | — | 0.56 | |
| SFTok-BToken Length=64 (1d-tokenizer), #Code=8,1922025.12 | 1.44 | — | — | — | — | |
| VQGANCodebook Size N=64 x 64 & 32 x 32, dz=5122021.11 | 1.45 | — | — | — | — | |
| VQGAN**Latent Size=64 × 64 & 32 × 32, dim Z=512, Training=multi-scale hierarchical codebook2021.10 | 1.45 | — | — | — | — | |
| QLIPResolution=392px2025.03 | 1.46 | — | — | 25.36 | 0.69 | |
| VQGAN*Latent Size=32 × 32, dim Z=8192, Training=Gumbel-Softmax reparameterization2021.10 | 1.49 | — | — | — | — | |
| IBQRatio=16, Codebook Size=262144, Zero-shot=true2024.12 | 1.53 | — | — | 22.69 | 0.64 | |
| ViT-VQGAN2025.03 | 1.55 | — | — | — | — | |
| WeTokRatio=16, Resolution=256x2562026.05 | 1.58 | — | — | 22.38 | 0.62 | |
| MaskBitToken Length=256 (16×16), #Code=4,0962025.12 | 1.61 | — | — | — | — | |
| Open-MAGVIT2Ratio=16, Codebook Size=262144, Zero-shot=true2024.12 | 1.67 | — | — | 22.7 | 0.64 | |
| TiTok-BType=1D Tokenizer, #Tokens=64, Codebook Size=4096, Resolution=256x2562026.01 | 1.7 | — | — | 17.13 | — | |
| TiTok-BToken Length=64 (1d-tokenizer), #Code=4,0962025.12 | 1.7 | — | — | — | — | |
| TiTok-SType=1D Tokenizer, #Tokens=128, Codebook Size=4096, Resolution=256x2562026.01 | 1.71 | — | — | 17.8 | — | |
| VILA-UResolution=256, Code Shape=16×16×4, Codebook Size=16,384, Category=Unified Tokenizer, trained_on_billion_scale_datasets=true2026.03 | 1.8 | — | — | — | — | |
| VILA-UPre-trained Backbone=SigLIP-L/16-2562025.03 | 1.8 | — | — | 3.43 | 0.489 | |
| RQVAE# Tokens=1,024, Codebook Size=16,3842024.06 | 1.83 | — | — | — | — | |
| TiTok# TKS=64, Backbone=ViT-B, Decoder=Native ViT decoder of larger size2026.02 | 1.99 | — | 0.2571 | — | — | |
| IBQRatio=16, Codebook Size=16384, Zero-shot=true2024.12 | 2.06 | — | — | 22.01 | 0.61 | |
| TiTok-BLToken Length=64 (1d-tokenizer), #Code=8,1922025.12 | 2.06 | — | — | — | — | |
| One-D-Piece-LToken Length=64 (1d-tokenizer), #Code=4,0962025.12 | 2.1 | — | — | — | — | |
| LlamaGenType=2D Tokenizer, #Tokens=256, Codebook Size=16384, Resolution=256x2562026.01 | 2.19 | — | — | 20.79 | — | |
| LlamaGen-LToken Length=256 (16×16), #Code=16,3842025.12 | 2.19 | — | — | — | — | |
| LLaMAGenResolution=256, Code Shape=16×16, Codebook Size=16,384, Category=Reconstruction Only2026.03 | 2.19 | — | — | — | — | |
| TiTok-LType=1D Tokenizer, #Tokens=32, Codebook Size=4096, Resolution=256x2562026.01 | 2.21 | — | — | 15.96 | — | |
| Muse-VLResolution=256px2025.03 | 2.26 | — | — | 20.14 | 0.646 | |
| MaskGIT VQ-GANType=2D Tokenizer, #Tokens=256, Codebook Size=1024, Resolution=256x2562026.01 | 2.28 | — | — | — | — | |
| MaskGITToken Length=256 (16×16), #Code=1,0242025.12 | 2.28 | — | — | — | — | |
| One-D-Piece-BToken Length=64 (1d-tokenizer), #Code=4,0962025.12 | 2.39 | — | — | — | — | |
| LlamaGenRatio=16, Codebook Size=16384, Zero-shot=true, Initial Training=Pre-trained on ImageNet2024.12 | 2.47 | — | — | 20.65 | 0.54 | |
| LlamaGenRatio=16, Resolution=256x2562026.05 | 2.47 | — | — | 20.65 | 0.54 | |
| COSMOSToken Length=256 (16×16), #Code=64,0002025.12 | 2.52 | — | — | — | — | |
| Open-MAGVIT2Ratio=16, Codebook Size=16384, Zero-shot=true2024.12 | 2.55 | — | — | 22.21 | 0.62 | |
| Open-MAGVIT2-I-PTRatio=16, Resolution=256x2562026.05 | 2.55 | — | — | 22.21 | 0.62 | |
| STELLAR# TKS=16, Backbone=ViT-H2026.02 | 2.6 | — | 0.1729 | — | — | |
| VQGAN-LC# Tokens=256, Codebook Size=100,0002024.06 | 2.62 | 99.9 | 0.12 | 23.8 | 58.9 | |
| VQGAN-LCToken Length=256 (16×16), #Code=100,0002025.12 | 2.62 | — | — | — | — | |
| VQGAN-LCResolution=256, Code Shape=16×16, Codebook Size=16,384, Category=Reconstruction Only2026.03 | 2.62 | — | — | — | — | |
| RQVAE# Tokens=512, Codebook Size=16,3842024.06 | 2.69 | — | — | — | — | |
| RQ-VAE2025.03 | 2.69 | — | — | — | — | |
| VQGAN-LC# Tokens=256, Codebook Size=50,0002024.06 | 2.75 | 99.9 | 0.13 | 23.8 | 58.4 | |
| TiTok# TKS=32, Backbone=ViT-B, Decoder=Native ViT decoder of larger size2026.02 | 2.75 | — | 0.3281 | — | — | |
| STELLAR# TKS=196, Backbone=ViT-B2026.02 | 2.85 | — | 0.2085 | — | — | |
| VQ-VAE DecoderBackbone=Janus-Pro 7B, Resolution=384 × 3842026.03 | 2.8511 | — | 0.1541 | — | 0.5786 | |
| VQGAN-LC# Tokens=256, Codebook Size=16,3842024.06 | 3.01 | 99.9 | 0.13 | 23.2 | 56.4 | |
| MAE# TKS=196, Backbone=ViT-B2026.02 | 3.02 | — | 0.2071 | — | — | |
| LlamaGenType=2D Tokenizer, #Tokens=256, Codebook Size=4096, Resolution=256x2562026.01 | 3.02 | — | — | 19.99 | — | |
| STELLAR# TKS=16, Backbone=ViT-B2026.02 | 3.06 | — | 0.2077 | — | — | |
| RQVAE# Tokens=256, Codebook Size=16,3842024.06 | 3.2 | — | — | — | — | |
| RQ-VAEToken Length=256 (8×8×4), #Code=16,3842025.12 | 3.2 | — | — | — | — | |
| RQVAEResolution=256, Code Shape=16×16×4, Codebook Size=16,384, Category=Reconstruction Only2026.03 | 3.2 | — | — | — | — | |
| QLIPResolution=256px2025.03 | 3.21 | — | — | 23.16 | 0.628 | |
| QLIP-BRatio=16, Resolution=256x2562026.05 | 3.21 | — | — | 23.16 | 0.63 | |
| DINO# TKS=196, Backbone=ViT-B2026.02 | 3.27 | — | 0.2121 | — | — | |
| AugVAE-SLCodebook Size N=32 x 32, dz=81922021.11 | 3.28 | — | — | — | — | |
| VQGAN-EMA# Tokens=256, Codebook Size=16,3842024.06 | 3.41 | 83.2 | 0.14 | 23.5 | 56.6 |