Image Reconstruction on ImageNet 256x256 (val)
0.27rFIDVA-VAE
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| VA-VAEGenerator=SiT-XL, #Params=675M, Epochs=802026.05 | 0.27 | 0.097 | 27.7 | 77.9 | — | |
| VA-VAETokenizer=VA-VAE2025.01 | 0.28 | — | — | — | — | |
| VAVAE2026.01 | 0.28 | — | 27.96 | — | — | |
| LightingDiTTokenizer=VA-VAE, Training Epoch=80, #params=675M, Architecture=Latent Diffusion Models (LDM)2026.01 | 0.28 | — | — | — | — | |
| LightingDiTTokenizer=VA-VAE, Training Epoch=800, #params=675M, Architecture=Latent Diffusion Models (LDM)2026.01 | 0.28 | — | — | — | — | |
| REPA (with E2E-VAE)Tokenizer=E2E-VAE, Training Epoch=80, #params=675M, Architecture=Latent Diffusion Models (LDM)2026.01 | 0.28 | — | — | — | — | |
| REPA (with E2E-VAE)Tokenizer=E2E-VAE, Training Epoch=800, #params=675M, Architecture=Latent Diffusion Models (LDM)2026.01 | 0.28 | — | — | — | — | |
| VA-VAEResolution=256x2562026.05 | 0.28 | — | 27.96 | 79 | — | |
| DRoRAE (Phase 3)Generator=DiTDH-XL, #Params=839M, Epochs=80, Phase=3, Decoder=fine-tuned2026.05 | 0.29 | 0.134 | 24.32 | 70.1 | — | |
| REPA (with Send-VAE)Tokenizer=Send-VAE, Training Epoch=80, #params=675M, Architecture=Latent Diffusion Models (LDM)2026.01 | 0.31 | — | — | — | — | |
| REPA (with Send-VAE)Tokenizer=Send-VAE, Training Epoch=800, #params=675M, Architecture=Latent Diffusion Models (LDM)2026.01 | 0.31 | — | — | — | — | |
| DINO-SAEEncoder=DINOv3 Large2026.01 | 0.37 | — | 26.2 | — | — | |
| DRoRAE (Phase 2)Generator=DiTDH-XL, #Params=839M, Epochs=80, Phase=2, Decoder=frozen2026.05 | 0.47 | 0.195 | 21.79 | 58.3 | — | |
| DecQResolution=256x256, VFM=DINOv2-B, Decoder=ViT-XL2026.05 | 0.47 | — | 22.76 | 63 | — | |
| MAETok2026.01 | 0.48 | — | 23.61 | — | — | |
| LightingDiTTokenizer=MAETok, Training Epoch=800, #params=675M, Architecture=Latent Diffusion Models (LDM)2026.01 | 0.48 | — | — | — | — | |
| RPiAEGenerator=LightningDiT, #Params=675M, Epochs=802026.05 | 0.5 | 0.216 | 21.3 | 52.5 | — | |
| RPiAEResolution=256x2562026.05 | 0.5 | — | 21.3 | 53 | — | |
| GigaTok-B-LParam.=622M, Discriminator=Frozen DINO [7]2025.04 | 0.51 | 0.206 | 21.32 | 69.1 | — | |
| MARTokenizer=LDM2025.01 | 0.53 | — | — | — | — | |
| MARTokenizer=LDM, Training Epoch=800, #params=945M, Architecture=AutoRegressive (AR)2026.01 | 0.53 | — | — | — | — | |
| RAEGenerator=DiTDH-XL, #Params=839M, Epochs=802026.05 | 0.57 | 0.256 | 18.8 | 48.3 | — | |
| LlamaGenTokenizer=VQGAN2025.01 | 0.59 | — | — | — | — | |
| RAE2026.01 | 0.59 | — | 18.94 | — | — | |
| LlamaGenTokenizer=VQGAN, Training Epoch=300, #params=3.1B, Architecture=AutoRegressive (AR)2026.01 | 0.59 | — | — | — | — | |
| SD-VAETokenizer=SD-VAE2025.01 | 0.61 | — | — | — | — | |
| MaskDiTTokenizer=SD-VAE, Training Epoch=1600, #params=675M, Architecture=Latent Diffusion Models (LDM)2026.01 | 0.61 | — | — | — | — | |
| FastDiTTokenizer=SD-VAE, Training Epoch=400, #params=675M, Architecture=Latent Diffusion Models (LDM)2026.01 | 0.61 | — | — | — | — | |
| SD-VAEGenerator=DiT-XL, #Params=675M, Epochs=14002026.05 | 0.61 | 0.13 | 26.9 | 73.6 | — | |
| REPAGenerator=SiT-XL, #Params=675M, Epochs=802026.05 | 0.61 | 0.13 | 26.9 | 73.6 | — | |
| SD-VAEResolution=256x2562026.05 | 0.61 | — | 26.9 | 74 | — | |
| SD-VAE2026.01 | 0.62 | — | 26.04 | — | — | |
| SVGGenerator=SVG-XL, #Params=675M, Epochs=802026.05 | 0.65 | — | — | — | — | |
| SVGResolution=256x2562026.05 | 0.65 | — | 23.89 | 65 | — | |
| FAE-d32Generator=LightningDiT, #Params=675M, Epochs=802026.05 | 0.68 | — | — | — | — | |
| FAEResolution=256x2562026.05 | 0.68 | — | — | — | — | |
| RAEResolution=256x2562026.05 | 0.69 | — | 19.13 | 49 | — | |
| GigaTok-XL-XXLParam.=2.9B2025.04 | 0.79 | 0.1947 | 21.65 | 69.9 | — | |
| GigaTok-B-LParam.=622M2025.04 | 0.81 | 0.2059 | 21.21 | 68.5 | — | |
| GigaTok-S-BParam.=232M2025.04 | 0.89 | 0.2121 | 20.93 | 67.7 | — | |
| GigaTok-S-SParam.=136M2025.04 | 1.01 | 0.2226 | 20.74 | 67 | — | |
| ViT-VQGAN#Tokens=Fixed, Latent size=32 x 322024.06 | 1.28 | — | — | — | — | |
| MagViT-v2Tokenizer=LFQ tokenizers, Training Epoch=1080, #params=307M, Architecture=AutoRegressive (AR)2026.01 | 1.5 | — | — | — | — | |
| SeTok#Tokens=Dynamic2024.06 | 2.07 | — | — | — | — | |
| LlamaGen-Tok.Param.=72M2025.04 | 2.19 | — | 20.79 | 67.5 | — | |
| TiTok#Tokens=Fixed, Latent size=32 x 12024.06 | 2.21 | — | — | — | — | |
| VQGANGenerator=MaskGiT, #Params=227M, Epochs=5552026.05 | 2.23 | 0.202 | 17.9 | 42.2 | — | |
| MaskGITTokenizer=MaskGIT2025.01 | 2.28 | — | — | — | — | |
| MaskGITTokenizer=MaskGIT, Training Epoch=555, #params=227M, Architecture=AutoRegressive (AR)2026.01 | 2.28 | — | — | — | — | |
| VAE#Tokens=Fixed, Latent size=32 x 322024.06 | 2.63 | — | — | — | — | |
| RQ-VAE#Tokens=Fixed, Latent size=16 x 162024.06 | 3.2 | — | — | — | — | |
| MQ-VAE#Tokens=Fixed, Latent size=32 x 322024.06 | 5.29 | — | — | — | — | |
| VQ-GAN#Tokens=Fixed, Latent size=16 x 162024.06 | 7.94 | — | — | — | — | |
| +REPATok. Model=KL, Token Type=2D, # Params (T)=84M, # Tokens=1024, Pretrained vision models=true2026.03 | — | — | — | — | 0.62 | |
| GigaTokTok. Model=VQ, Token Type=1D, # Params (T)=622M, # Tokens=256, Pretrained vision models=true2026.03 | — | — | — | — | 0.51 | |
| ImageFolderTok. Model=MSRQ, Token Type=1D, # Params (T)=176M, # Tokens=286, Pretrained vision models=true2026.03 | — | — | — | — | 0.8 | |
| l-DeTokTok. Model=KL, Token Type=2D, # Params (T)=172M, # Tokens=256, Pretrained vision models=false2026.03 | — | — | — | — | 0.62 | |
| LightningDiTTok. Model=KL, Token Type=2D, # Params (T)=70M, # Tokens=256, Pretrained vision models=true2026.03 | — | — | — | — | 0.28 | |
| LlamaGen-3BTok. Model=VQ, Token Type=2D, # Params (T)=72M, # Tokens=576, Pretrained vision models=false2026.03 | — | — | — | — | 2.19 | |
| MacTokTok. Model=KL, Token Type=1D, # Params (T)=176M, # Tokens=64, Pretrained vision models=true2026.03 | — | — | — | — | 0.75 | |
| MacTokTok. Model=KL, Token Type=1D, # Params (T)=176M, # Tokens=128, Pretrained vision models=true2026.03 | — | — | — | — | 0.43 | |
| MAETokTok. Model=AE, Token Type=1D, # Params (T)=176M, # Tokens=128, Pretrained vision models=true2026.03 | — | — | — | — | 0.48 | |
| MAR-HTok. Model=KL, Token Type=2D, # Params (T)=66M, # Tokens=256, Pretrained vision models=false2026.03 | — | — | — | — | 1.22 | |
| MaskBitTok. Model=LFQ, Token Type=2D, # Params (T)=54M, # Tokens=256, Pretrained vision models=false2026.03 | — | — | — | — | 1.61 | |
| MaskGITTok. Model=VQ, Token Type=2D, # Params (T)=66M, # Tokens=256, Pretrained vision models=false2026.03 | — | — | — | — | 2.28 | |
| MDTv2-XL/2Tok. Model=KL, Token Type=2D, # Params (T)=55M, # Tokens=4096, Pretrained vision models=false2026.03 | — | — | — | — | 0.27 | |
| RQ-Trans.Tok. Model=RQ, Token Type=2D, # Params (T)=66M, # Tokens=256, Pretrained vision models=false2026.03 | — | — | — | — | 3.2 | |
| SoftVQ-VAETok. Model=SoftVQ, Token Type=1D, # Params (T)=176M, # Tokens=64, Pretrained vision models=true2026.03 | — | — | — | — | 0.88 | |
| TexTok-256Tok. Model=KL, Token Type=1D, # Params (T)=176M, # Tokens=256, Pretrained vision models=false2026.03 | — | — | — | — | 0.73 | |
| TiTok-S-128Tok. Model=VQ, Token Type=1D, # Params (T)=72M, # Tokens=128, Pretrained vision models=false2026.03 | — | — | — | — | 1.61 | |
| VARTok. Model=MSRQ, Token Type=2D, # Params (T)=109M, # Tokens=680, Pretrained vision models=false2026.03 | — | — | — | — | 0.9 | |
| ViT-VQGANTok. Model=VQ, Token Type=2D, # Params (T)=64M, # Tokens=1024, Pretrained vision models=false2026.03 | — | — | — | — | 1.28 | |
| WeTokTok. Model=VQ, Token Type=2D, # Params (T)=400M, # Tokens=256, Pretrained vision models=false2026.03 | — | — | — | — | 0.6 |