Image Reconstruction on ImageNet 256x256
0.18rFIDViTok S-B
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| ViTok S-BLatent Tokens=2562026.04 | 0.18 | — | — | — | — | — | |
| VAELatent dim=32x32x12, Encoder parameters=34.16M2024.05 | 0.23 | 30.41 | 0.86 | 0.073 | — | — | |
| LiteVAELatent dim=32x32x12, Encoder parameters=6.75M2024.05 | 0.23 | 30.91 | 0.88 | 0.072 | — | — | |
| AlignTokTraining Epochs=64, #Params=675M2025.12 | 0.26 | 25.8 | — | — | — | — | |
| AlignTokTraining Epochs=800, #Params=675M2025.12 | 0.26 | 25.8 | — | — | — | — | |
| SiT-XL†Tokenizer=VA-VAE, Training Epochs=80, Steps=250, #params=675M2025.10 | 0.26 | — | — | — | — | — | |
| SiT-XL†Tokenizer=VA-VAE, Training Epochs=80, Steps=25, #params=675M2025.10 | 0.26 | — | — | — | — | — | |
| DC-AE-1.5Latent Tokens=642026.04 | 0.26 | — | — | — | — | — | |
| DC-AELatent Tokens=642026.04 | 0.26 | — | — | — | — | — | |
| MGVQ-G8Quantization=VQ, Ratio=8, Dim=32, Size=2048 x 8, Capacity=2048^8 = 2^88, Codebook Usage=100%2025.07 | 0.27 | 29.96 | 0.918 | — | — | — | |
| VAETok. Type/Param.=KL† 55M, #Tokens=40962025.04 | 0.27 | — | — | — | — | — | |
| VAELatent Tokens=40962026.04 | 0.27 | — | — | — | — | — | |
| LDM-4Tokenizer Type=SD-VAE, Tokenizer #Params=55M, Tokenizer #Tokens=64ˆ642026.05 | 0.27 | — | — | — | — | — | |
| VA-VAETokenizer=VA-VAE2025.04 | 0.28 | — | — | — | — | — | |
| E2E-VAE (Ours)Tokenizer=E2E-VAE (Ours)2025.04 | 0.28 | — | — | — | — | — | |
| VA-VAETraining Epochs=64, #Params=675M2025.12 | 0.28 | 27.6 | — | — | — | — | |
| VA-VAETraining Epochs=800, #Params=675M2025.12 | 0.28 | 27.6 | — | — | — | — | |
| VA-VAEEpochs=800, Parameters=675M, External pretrained models=true2025.12 | 0.28 | 26.32 | — | — | — | — | |
| REPA-EEpochs=800, Parameters=675M, External pretrained models=true2025.12 | 0.28 | 26.25 | — | — | — | — | |
| VA-VAETok. Type/Param.=KL 70M, #Tokens=2562025.04 | 0.28 | — | — | — | — | — | |
| VA-VAEAdv.=true, Pretrained Encoder=DINOv22026.03 | 0.28 | — | — | — | — | — | |
| Lightning-DiT-XLTokenizer Type=VA-VAE, Tokenizer #Params=84M, Tokenizer #Tokens=32ˆ322026.05 | 0.28 | — | — | — | — | — | |
| MGVQ-G4Quantization=VQ, Ratio=8, Dim=32, Size=8192 x 4, Capacity=8192^4 = 2^52, Codebook Usage=100%2025.07 | 0.31 | 28.42 | 0.898 | — | — | — | |
| UniTokDynamic Resolution=unsupported, Dynamic Tokens=unsupported, Tokens=2562026.04 | 0.33 | — | — | — | — | — | |
| OpenMagvit2Quantization=LFQ, Ratio=8, Dim=18, Size=262144, Capacity=262144^1 = 2^18, Codebook Usage=100%2025.07 | 0.34 | 27.02 | — | — | — | — | |
| TC-AELatent Tokens=642026.04 | 0.35 | — | — | — | — | — | |
| VibeToken-LLDynamic Resolution=supported, Dynamic Tokens=supported, Tokens=32–2562026.04 | 0.4 | — | — | — | — | — | |
| VibeToken-SLDynamic Resolution=supported, Dynamic Tokens=supported, Tokens=32–2562026.04 | 0.43 | — | — | — | — | — | |
| MergeTok-BLType=1D VAE+VQ, #Tok.=256, Down. ratio=162026.05 | 0.47 | — | — | — | — | — | |
| MAETokLatent Tokens=2562026.04 | 0.48 | — | — | — | — | — | |
| MGVQ-G8Quantization=VQ, Ratio=16, Dim=32, Size=2048 x 8, Capacity=2048^8 = 2^88, Codebook Usage=100%2025.07 | 0.49 | 24.7 | 0.787 | — | — | — | |
| RAE (DINOv2-S)Type=1D VAE, #Tok.=256, Down. ratio=162026.05 | 0.49 | — | — | — | — | — | |
| GigaTok-B-LTok. Type/Param.=VQ 622M, #Tokens=256, DINO Discriminator=true2025.04 | 0.51 | — | — | — | — | — | |
| UNITE-B (Ours) + GAN decoder ft†Adv.=true, Pretrained Encoder=-2026.03 | 0.51 | — | — | — | — | — | |
| GigaTok-B-LLatent Tokens=2562026.04 | 0.51 | — | — | — | — | — | |
| MARTokenizer=LDM, Training Epochs=800, #params=945M2025.04 | 0.53 | — | — | — | — | — | |
| MAREpochs=800, Parameters=943M, External pretrained models=false2025.12 | 0.53 | 26.18 | — | — | — | — | |
| xAREpochs=800, Parameters=1.1B, External pretrained models=false2025.12 | 0.53 | 26.18 | — | — | — | — | |
| VAETok. Type/Param.=KL 66M, #Tokens=2562025.04 | 0.53 | — | — | — | — | — | |
| VAELatent Tokens=2562026.04 | 0.53 | — | — | — | — | — | |
| DetailFlowDynamic Resolution=unsupported, Dynamic Tokens=unsupported, Tokens=5122026.04 | 0.55 | — | — | — | — | — | |
| HBQM=4, Tokenizer Type=Discrete, Spatial Ratio=16, Latent Channel=16, Channel Bits=4, Compress Ratio=962026.04 | 0.56 | 23.01 | 0.71 | 0.13 | — | — | |
| RAE(DiTDH-XL)Training Epochs=800, #Params=839M2025.12 | 0.57 | 18.9 | — | — | — | — | |
| RAE(DiT-XL)Training Epochs=800, #Params=675M2025.12 | 0.57 | 18.9 | — | — | — | — | |
| RAEEpochs=800, Parameters=839M, External pretrained models=true2025.12 | 0.57 | 18.86 | — | — | — | — | |
| RAEAdv.=true, Pretrained Encoder=DINOv22026.03 | 0.58 | — | — | — | — | — | |
| LlamaGenQuantization=VQ, Ratio=8, Dim=8, Size=16384, Capacity=16384^1 = 2^142025.07 | 0.59 | 24.45 | 0.813 | — | — | — | |
| LlamaGenTokenizer=VQGAN, Training Epochs=300, #params=3.1B2025.04 | 0.59 | — | — | — | — | — | |
| LlamaGenTraining Epochs=300, #Params=3.1B2025.12 | 0.59 | 24.45 | — | — | — | — | |
| LlamaGenTokenizer=VQGAN, Training Epochs=300, Steps=256, #params=3.1B2025.10 | 0.59 | — | — | — | — | — | |
| VQGANLatent Tokens=2562026.04 | 0.59 | — | — | — | — | — | |
| SD-VAETokenizer=SD-VAE2025.04 | 0.61 | — | — | — | — | — | |
| SiTTraining Epochs=1400, #Params=675M2025.12 | 0.61 | 26 | — | — | — | — | |
| FasterDitTraining Epochs=400, #Params=675M2025.12 | 0.61 | 26 | — | — | — | — | |
| DiTEpochs=1400, Parameters=675M, External pretrained models=false2025.12 | 0.61 | 24.98 | — | — | — | — | |
| MaskDiTEpochs=1600, Parameters=675M, External pretrained models=false2025.12 | 0.61 | 24.98 | — | — | — | — | |
| SiTEpochs=1400, Parameters=675M, External pretrained models=false2025.12 | 0.61 | 24.98 | — | — | — | — | |
| MDTv2Epochs=1080, Parameters=675M, External pretrained models=false2025.12 | 0.61 | 24.98 | — | — | — | — | |
| REPAEpochs=800, Parameters=675M, External pretrained models=true2025.12 | 0.61 | 24.98 | — | — | — | — | |
| DDTEpochs=400, Parameters=675M, External pretrained models=true2025.12 | 0.61 | 24.98 | — | — | — | — | |
| MaskDiT-XLTokenizer=SD-VAE, Training Epochs=1600, Steps=250, #params=675M2025.10 | 0.61 | — | — | — | — | — | |
| DiT-XLTokenizer=SD-VAE, Training Epochs=1400, Steps=250, #params=675M2025.10 | 0.61 | — | — | — | — | — | |
| SiT-XLTokenizer=SD-VAE, Training Epochs=1400, Steps=250, #params=675M2025.10 | 0.61 | — | — | — | — | — | |
| REPA-XLTokenizer=SD-VAE, Training Epochs=800, Steps=250, #params=675M2025.10 | 0.61 | — | — | — | — | — | |
| REPA-XLTokenizer=SD-VAE, Training Epochs=80, Steps=250, #params=675M2025.10 | 0.61 | — | — | — | — | — | |
| SiT-XL†Tokenizer=SD-VAE, Training Epochs=80, Steps=25, #params=675M2025.10 | 0.61 | — | — | — | — | — | |
| SD-VAELatent Tokens=2562026.04 | 0.61 | — | — | — | — | — | |
| SoftVQ-L*Type=1D VQ, #Tok.=64, Down. ratio=162026.05 | 0.61 | — | — | — | — | — | |
| SD-VAEType=2D VAE, #Tok.=32^2, Down. ratio=82026.05 | 0.61 | — | — | — | — | — | |
| REPAType=2D VAE, #Tok.=32^2, Down. ratio=82026.05 | 0.61 | — | — | — | — | — | |
| VAVAEType=2D VAE, #Tok.=16^2, Down. ratio=162026.05 | 0.61 | — | — | — | — | — | |
| SD-VAETok. Type/Param.=KL† 84M, #Tokens=10242025.04 | 0.62 | — | — | — | — | — | |
| SD-VAEAdv.=true, Pretrained Encoder=-2026.03 | 0.62 | — | — | — | — | — | |
| RAETokenizer Type=Continuous, Spatial Ratio=16, Latent Channel=768, Channel Bits=16, Compress Ratio=0.52026.04 | 0.62 | 19.2 | 0.44 | 0.25 | — | — | |
| DiT-XL/2Tokenizer Type=SD-VAE, Tokenizer #Params=84M, Tokenizer #Tokens=32ˆ322026.05 | 0.62 | — | — | — | — | — | |
| REPA-XL/2Tokenizer Type=SD-VAE, Tokenizer #Params=84M, Tokenizer #Tokens=32ˆ322026.05 | 0.62 | — | — | — | — | — | |
| MGVQ-G4Quantization=VQ, Ratio=16, Dim=32, Size=8192 x 4, Capacity=8192^4 = 2^52, Codebook Usage=100%2025.07 | 0.64 | 23.71 | 0.755 | — | — | — | |
| DMVAETraining Epochs=64, #Params=675M2025.12 | 0.64 | 21.5 | — | — | — | — | |
| DMVAETraining Epochs=400, #Params=675M2025.12 | 0.64 | 21.5 | — | — | — | — | |
| DMVAETraining Epochs=800, #Params=675M2025.12 | 0.64 | 21.5 | — | — | — | — | |
| SVG-XLTokenizer=SVGTok, Training Epochs=80, Steps=25, #params=675M2025.10 | 0.65 | — | — | — | — | — | |
| SVG-XLTokenizer=SVGTok, Training Epochs=500, Steps=25, #params=675M2025.10 | 0.65 | — | — | — | — | — | |
| SVG-XLTokenizer=SVGTok, Training Epochs=1400, Steps=25, #params=675M2025.10 | 0.65 | — | — | — | — | — | |
| SoftVQ-BL*Type=1D VQ, #Tok.=64, Down. ratio=162026.05 | 0.65 | — | — | — | — | — | |
| SemTokType=1D, Quant=BSQ, #Bits-per-pixel=0.125, #Token=256, #Codebook=2^322026.03 | 0.67 | 23.05 | 0.684 | 0.1 | — | — | |
| SDXL-VAEQuantization=Continuous, Ratio=8, Dim=4, Training Data=unknown2025.07 | 0.68 | 26.04 | 0.834 | — | — | — | |
| DC-AESetting (f/c)=f32c32, Latent Shape=8x8x322024.10 | 0.69 | 23.85 | 0.66 | 0.082 | — | — | |
| DC-AE-f32Adv.=true, Pretrained Encoder=-2026.03 | 0.69 | — | — | — | — | — | |
| DC-AE-f32Type=2D VAE, #Tok.=8^2, Down. ratio=322026.05 | 0.69 | — | — | — | — | — | |
| EOSTok-HTokenizer Type=1D IBQ, Tokenizer #Params=388M, Tokenizer #Tokens=2562026.05 | 0.71 | — | — | — | — | — | |
| SemanticistTokenizer Type=1D VAE Flow, Tokenizer #Tokens=1-2562026.05 | 0.72 | — | — | — | — | — | |
| EOSTok-BTokenizer Type=1D IBQ, Tokenizer #Params=165M, Tokenizer #Tokens=2562026.05 | 0.73 | — | — | — | — | — | |
| EOSTok-LTokenizer Type=1D IBQ, Tokenizer #Params=165M, Tokenizer #Tokens=2562026.05 | 0.73 | — | — | — | — | — | |
| SD-VAEQuantization=Continuous, Ratio=8, Dim=4, Training Data=unknown2025.07 | 0.74 | 25.68 | 0.82 | — | — | — | |
| EOSTok-STokenizer Type=1D IBQ, Tokenizer #Params=165M, Tokenizer #Tokens=2562026.05 | 0.74 | — | — | — | — | — | |
| GigaTok-XL-XXLTok. Type/Param.=VQ 2.9B, #Tokens=2562025.04 | 0.79 | — | — | — | — | — | |
| ImageFolderType=AR, Number of Parameters=362M, Sequence Length=286, Sampling Steps=102025.03 | 0.8 | — | — | — | 7.23 | — | |
| ImageFolderTok. Type/Param.=MSRQ 176M, #Tokens=2862025.04 | 0.8 | — | — | — | — | — | |
| ImageFolderDynamic Resolution=unsupported, Dynamic Tokens=unsupported, Tokens=2862026.04 | 0.8 | — | — | — | — | — | |
| SoftVQ-S*Type=1D VQ, #Tok.=256, Down. ratio=162026.05 | 0.8 | — | — | — | — | — |