Class-conditional image generation on ImageNet 256x256 (val)
366Inception Score (IS)SiT-XL/2 (REPA)
Evaluation Results
| Method | Links | ||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SiT-XL/2 (REPA)Guidance scale (ω)=1.8, Sampler=ODE, Resolution=256x256, Samples=50k, Inference timesteps=2502026.03 | 366 | — | — | — | 86 | 54 | 3.64 | 4.9 | — | — | — | — | — | — | — | — | — | — | |
| FPPrec. (W/A)=32/32, Sampling steps=202025.05 | 364.72 | — | — | — | — | — | 11.69 | 7.67 | — | — | — | — | — | — | — | — | — | — | |
| C2FGBackbone=SiT-XL/2 (REPA), Guidance scale (ω0)=1.7, λ=0.15, Sampler=ODE, Resolution=256x256, Samples=50k, Inference timesteps=2502026.03 | 364.2 | — | — | — | 86 | 55 | 3.4 | 4.7 | — | — | — | — | — | — | — | — | — | — | |
| EDA-DMPrec. (W/A)=6/6, Sampling steps=202025.05 | 360.77 | — | — | — | — | — | 11.52 | 8.02 | — | — | — | — | — | — | — | — | — | — | |
| IAR2-XXL*Type=AR, Parameters=1.5B, Reject sampling=true, variant=row_62025.10 | 360.6 | — | — | — | 78 | 61 | 2.1 | — | — | — | — | — | — | — | — | — | — | — | |
| VAR-d30Params.=2.0B, Rejection sampling=true, Resolution=256x2562024.10 | 356.4 | — | — | — | 83 | 57 | 1.8 | — | — | — | — | — | — | — | — | — | — | — | |
| MaskGIT-reType=Bi-directional AR, #Para.=227M, Steps=8, Rejection Sampling=true2025.04 | 355.6 | — | — | — | — | — | 4.02 | — | — | — | — | — | — | — | — | — | — | — | |
| MaskGIT*Type=Mask., Parameters=227M, Reject sampling=true2025.10 | 355.6 | — | — | — | — | — | 4.02 | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientDMPrec. (W/A)=6/6, Sampling steps=202025.05 | 351.79 | — | — | — | — | — | 9.54 | 6.88 | — | — | — | — | — | — | — | — | — | — | |
| OursPrec. (W/A)=6/6, LoRA Hub size (h)=4, Sampling steps=202025.05 | 351.79 | — | — | — | — | — | 10.1 | 6.65 | — | — | — | — | — | — | — | — | — | — | |
| VAR_d30Classifier-Free Guidance (CFG)=true2025.02 | 350.2 | — | — | — | 82 | 60 | 1.73 | — | — | — | — | — | — | — | — | — | — | — | |
| VAREpochs=350, #Params=2.0B, Model Space=Latent Autoregressive, Guidance=w/ guidance2026.05 | 350.2 | — | — | — | 82 | 60 | — | — | — | — | — | — | — | 1.73 | — | — | — | — | |
| OursPrec. (W/A)=6/6, LoRA Hub size (h)=2, Sampling steps=202025.05 | 349.91 | — | — | — | — | — | 10.1 | 7.43 | — | — | — | — | — | — | — | — | — | — | |
| FractalMAR-HType=Pixel, Epochs=600, CFG=Enabled2026.02 | 348.9 | — | — | — | 81 | 46 | 6.15 | — | — | — | — | — | — | — | — | — | — | — | |
| Flow-DPMNumber of Function Evaluations (NFE)=152026.01 | 341.85 | — | — | — | 83 | 58 | 2.32 | 5.49 | — | — | — | — | — | — | — | — | — | — | |
| VAR-d30Params.=2.0B, Rejection sampling=false, Resolution=256x2562024.10 | 334.7 | — | — | — | 81 | 61 | 1.97 | — | — | — | — | — | — | — | — | — | — | — | |
| ELM-XLParams.=757M, Tokenizer configuration=2-10, Rejection sampling=false, Resolution=256x2562024.10 | 332.99 | — | — | — | 80 | 59 | 1.79 | — | — | — | — | — | — | — | — | — | — | — | |
| ELM-2BParams.=1.9B, Tokenizer configuration=2-12, Rejection sampling=false, Resolution=256x2562024.10 | 332.69 | — | — | — | 81 | 60 | 1.54 | — | — | — | — | — | — | — | — | — | — | — | |
| ELM-XXLParams.=1.4B, Tokenizer configuration=2-12, Rejection sampling=false, Resolution=256x2562024.10 | 330.43 | — | — | — | 80 | 60 | 1.58 | — | — | — | — | — | — | — | — | — | — | — | |
| ComposerBackbone=VAR d-30, Step=10, Parameter=2.2B, Time=1.07 (+7%), Memory=16.97G2026.03 | 330.4 | — | — | — | 83 | 63 | 1.79 | — | — | — | — | — | — | — | — | — | — | — | |
| MaskBitFamily=Masked & AR, Steps=256, #Params=305M, Config=Record 12025.09 | 328.6 | — | — | — | — | — | 1.52 | — | — | — | — | — | — | — | — | — | — | — | |
| Flow-UniPCNumber of Function Evaluations (NFE)=152026.01 | 327.72 | — | — | — | 82 | 58 | 2.59 | 8.37 | — | — | — | — | — | — | — | — | — | — | |
| Test-time TrainingBackbone=VAR d-30, Step=10, Parameter=2.0B, Time=112.37 (+11,137%), Memory=28.41G2026.03 | 327.7 | — | — | — | 81 | 62 | 1.85 | — | — | — | — | — | — | — | — | — | — | — | |
| Euler-SolverNumber of Function Evaluations (NFE)=152026.01 | 326.91 | — | — | — | 82 | 57 | 2.56 | 4.76 | — | — | — | — | — | — | — | — | — | — | |
| BA-solverNumber of Function Evaluations (NFE)=152026.01 | 326.67 | — | — | — | 81 | 62 | 1.65 | 4.43 | — | — | — | — | — | — | — | — | — | — | |
| RAR_XXLClassifier-Free Guidance (CFG)=true2025.02 | 326 | — | — | — | 80 | 63 | 1.48 | — | — | — | — | — | — | — | — | — | — | — | |
| RAR-XXLToken Type=Discrete Tokens, Train Tokens=131M, Infer Tokens=256, #Params=1.5B2026.02 | 326 | — | — | — | 80 | 63 | 1.48 | — | — | — | — | — | — | — | — | — | — | — | |
| LFQ + MAGVITv2Tokenizer=LFQ, Generator=MAGVITv2, Type=MGM, #Params=307 M, CFG=w/ CFG2025.10 | 324.3 | — | — | — | — | — | — | — | — | — | — | — | — | 1.91 | — | — | — | — | |
| RQTran.Params.=3.8B, Rejection sampling=true, Resolution=256x2562024.10 | 323.7 | — | — | — | — | — | 3.8 | — | — | — | — | — | — | — | — | — | — | — | |
| RQTran.-reType=AR, #Para.=3.8B2024.09 | 323.7 | — | — | — | — | — | 3.8 | — | — | — | — | — | — | — | — | — | — | — | |
| RQTran.*Type=AR, Parameters=3.8B, Reject sampling=true2025.10 | 323.7 | — | — | — | — | — | 3.8 | — | — | — | — | — | — | — | — | — | — | — | |
| VAR-d30Type=VAR, #Para.=2.0B2024.09 | 323.1 | — | — | — | 82 | 59 | 1.92 | — | — | — | — | — | — | — | — | — | — | — | |
| VAR-d30Token Type=Discrete Tokens, Train Tokens=115M, Infer Tokens=256, #Params=2B2026.02 | 323.1 | — | — | — | 82 | 59 | 1.92 | — | — | — | — | — | — | — | — | — | — | — | |
| StandardBackbone=VAR d-30, Step=10, Parameter=2.0B, Time=1, Memory=16.57G2026.03 | 323.1 | — | — | — | 82 | 59 | 1.97 | — | — | — | — | — | — | — | — | — | — | — | |
| VAREpochs=350, #Params=2.0B, Model Space=Latent Autoregressive, Guidance=w/o guidance2026.05 | 323.1 | — | — | — | 82 | 59 | — | — | — | — | — | — | — | 1.92 | — | — | — | — | |
| VAR-d30Type=VAR., Parameters=2.0B, Reject sampling=false2025.10 | 323.1 | — | — | — | 82 | 59 | 1.92 | — | — | — | — | — | — | — | — | — | — | — | |
| RandAR-XXLToken Type=Discrete Tokens, Train Tokens=98M, Infer Tokens=256, #Params=1.4B2026.02 | 322 | — | — | — | 79 | 62 | 2.15 | — | — | — | — | — | — | — | — | — | — | — | |
| SiT-XL/2 + MGClassifier-Free Guidance (CFG)=false2025.02 | 321.5 | — | — | — | 81 | 65 | 1.34 | 4.58 | — | — | — | — | — | — | — | — | — | — | |
| BA-solverNumber of Function Evaluations (NFE)=72026.01 | 320.49 | — | — | — | 78 | 64 | 1.96 | 6.06 | — | — | — | — | — | — | — | — | — | — | |
| MaskBitFamily=Masked & AR, Steps=64, #Params=305M2025.09 | 319.97 | — | — | — | 81 | 60 | 1.66 | — | — | — | — | — | — | — | — | — | — | — | |
| ComposerBackbone=VAR d-24, Step=10, Parameter=1.15B, Time=0.63 (+5%), Memory=8.51G2026.03 | 319.5 | — | — | — | 83 | 64 | 2.08 | — | — | — | — | — | — | — | — | — | — | — | |
| MAGVIT-v2Token Type=Discrete Tokens, Train Tokens=88M, Infer Tokens=256, #Params=307M2026.02 | 319.4 | — | — | — | — | — | 1.78 | — | — | — | — | — | — | — | — | — | — | — | |
| MAGVIT-v2Family=Masked & AR, Steps=64, #Params=307M2025.09 | 319.4 | — | — | — | — | — | 1.78 | — | — | — | — | — | — | — | — | — | — | — | |
| Flow-DPMNumber of Function Evaluations (NFE)=102026.01 | 318.08 | — | — | — | 82 | 57 | 2.62 | 6.27 | — | — | — | — | — | — | — | — | — | — | |
| Test-time TrainingBackbone=VAR d-24, Step=10, Parameter=1.0B, Time=75.84 (+12,540%), Memory=14.41G2026.03 | 317.3 | — | — | — | 80 | 64 | 2.15 | — | — | — | — | — | — | — | — | — | — | — | |
| Flow-UniPCNumber of Function Evaluations (NFE)=102026.01 | 316.97 | — | — | — | 83 | 52 | 3.27 | 6.09 | — | — | — | — | — | — | — | — | — | — | |
| C2FGBackbone=SiT-XL/2 (REPA), Guidance scale (ω0)=1, λ=1, Sampler=SDE, Resolution=256x256, Samples=50k, Inference timesteps=2502026.03 | 315 | — | — | — | 80 | 62 | 1.51 | 4.6 | — | — | — | — | — | — | — | — | — | — | |
| MDTv2Classifier-Free Guidance (CFG)=true2025.02 | 314.7 | — | — | — | 79 | 65 | 1.58 | 4.52 | — | — | — | — | — | — | — | — | — | — | |
| MDTv2Token Type=Continuous Tokens, Train Tokens=131B, Infer Tokens=256, #Params=675M2026.02 | 314.7 | — | — | — | 79 | 65 | 1.58 | — | — | — | — | — | — | — | — | — | — | — | |
| MDTv2Epochs=1080, #Params=675M, Model Space=Latent Diffusion, Guidance=w/ guidance2026.05 | 314.7 | — | — | — | 79 | 65 | — | — | — | — | — | — | — | 1.58 | — | — | — | 0.61 | |
| MDTv2Epochs=1080, Params=675M, CFG=true2026.06 | 314.7 | — | — | — | 79 | 65 | — | 4.52 | — | — | — | — | — | 1.58 | — | — | — | — | |
| Heun-SolverNumber of Function Evaluations (NFE)=152026.01 | 314.36 | — | — | — | 81 | 61 | 1.99 | 5.42 | — | — | — | — | — | — | — | — | — | — | |
| RandAR-XLToken Type=Discrete Tokens, Train Tokens=98M, Infer Tokens=256, #Params=775M2026.02 | 314.2 | — | — | — | 80 | 60 | 2.22 | — | — | — | — | — | — | — | — | — | — | — | |
| VAR-d24Params.=1.0B, Rejection sampling=false, Resolution=256x2562024.10 | 312.9 | — | — | — | 82 | 59 | 2.09 | — | — | — | — | — | — | — | — | — | — | — | |
| VAR-d24Type=VAR, #Para.=1.0B2024.09 | 312.9 | — | — | — | 82 | 59 | 2.09 | — | — | — | — | — | — | — | — | — | — | — | |
| StandardBackbone=VAR d-24, Step=10, Parameter=1.0B, Time=0.60, Memory=8.21G2026.03 | 312.9 | — | — | — | 82 | 59 | 2.33 | — | — | — | — | — | — | — | — | — | — | — | |
| LlamaGenTokenizer=Discrete, Params=3.1B, Steps=5762025.03 | 311.6 | — | — | — | 84 | 54 | 2.81 | — | — | — | — | — | — | — | 5 | — | — | — | |
| BA-solverNumber of Function Evaluations (NFE)=102026.01 | 311.16 | — | — | — | 80 | 63 | 1.72 | 4.92 | — | — | — | — | — | — | — | — | — | — | |
| DDTEpochs=400, #Params=675M, Model Space=Latent Diffusion, Guidance=w/ guidance2026.05 | 310.6 | — | — | — | 79 | 65 | — | — | — | — | — | — | — | 1.26 | — | — | — | 0.61 | |
| Di[M]O-MaskBitFamily=Discrete Distillation, Steps=1, #Params=305M2025.09 | 310.13 | — | — | — | 87 | 49 | 2.89 | — | — | — | — | — | — | — | — | — | — | — | |
| QUESTPrec. (W/A)=6/6, Sampling steps=202025.05 | 310.12 | — | — | — | — | — | 8.45 | 9.36 | — | — | — | — | — | — | — | — | — | — | |
| C2FGBackbone=SiT-XL/2 (REPA, Interval), Guidance scale (ω0)=1.8, λ=0.03, Sampler=SDE, Resolution=256x256, Samples=50k, Inference timesteps=2502026.03 | 308 | — | — | — | 80 | 65 | 1.41 | 4.7 | — | — | — | — | — | — | — | — | — | — | |
| RAR-XLToken Type=Discrete Tokens, Train Tokens=131M, Infer Tokens=256, #Params=955M2026.02 | 306.9 | — | — | — | 80 | 62 | 1.5 | — | — | — | — | — | — | — | — | — | — | — | |
| RAR-XLType=Causal AR, #Para.=955M, Steps=2562025.04 | 306.9 | — | — | — | 80 | 0.62 | 1.5 | — | — | — | — | — | — | — | — | — | — | — | |
| REPAEpochs=800, #Params=675M, Model Space=Latent Diffusion, Guidance=w/ guidance2026.05 | 306.3 | — | — | — | 79 | 64 | — | — | — | — | — | — | — | 1.29 | — | — | — | 0.61 | |
| BA-solverNumber of Function Evaluations (NFE)=52026.01 | 306.22 | — | — | — | 76 | 63 | 2.84 | 8.09 | — | — | — | — | — | — | — | — | — | — | |
| MaskBitFamily=Masked & AR, Steps=256, #Params=305M, Config=Record 22025.09 | 306.12 | — | — | — | 81 | 60 | 1.58 | — | — | — | — | — | — | — | — | — | — | — | |
| VARType=MIM+AR, #Param=600M, #Epoch=250, Classifier-free guidance=true2024.10 | 306.1 | — | — | — | — | — | 2.95 | — | — | — | — | — | — | — | — | — | — | — | |
| REPAClassifier-Free Guidance (CFG)=true2025.02 | 305.7 | — | — | — | 80 | 65 | 1.42 | 4.7 | — | — | — | — | — | — | — | — | — | — | |
| REPA-XL/2Type=Latent, Epochs=800, Sampler=Euler, Steps=250, CFG=Enabled2026.02 | 305.7 | — | — | — | 80 | 64 | 1.42 | — | — | — | — | — | — | — | — | — | — | — | |
| REPAToken Type=Continuous Tokens, Train Tokens=262B, Infer Tokens=256, #Params=675M2026.02 | 305.7 | — | — | — | 80 | 65 | 1.42 | — | — | — | — | — | — | — | — | — | — | — | |
| SD-VAE + REPATokenizer=SD-VAE, Generator=REPA, Type=LDM, #Params=675 M, CFG=w/ CFG2025.10 | 305.7 | — | — | — | — | — | — | — | — | — | — | — | — | 1.42 | — | — | — | — | |
| SiT-XL/2 (REPA, Interval)Guidance scale (ω)=1.8, tl=0, th=0.7, Sampler=SDE, Resolution=256x256, Samples=50k, Inference timesteps=2502026.03 | 305.7 | — | — | — | 80 | 65 | 1.42 | 4.7 | — | — | — | — | — | — | — | — | — | — | |
| MAR-H + Drift-ARArchitecture=MAR, Scale=H, Acceleration=Drift-AR, NFE=12026.03 | 304.6 | — | — | — | — | — | 1.53 | — | — | — | — | — | — | — | — | 1.93 | 5.16 | — | |
| MAR-HParams.=943M, Rejection sampling=false, Resolution=256x2562024.10 | 303.7 | — | — | — | 81 | 62 | 1.55 | — | — | — | — | — | — | — | — | — | — | — | |
| MAR-HClassifier-Free Guidance (CFG)=true2025.02 | 303.7 | — | — | — | 81 | 62 | 1.55 | — | — | — | — | — | — | — | — | — | — | — | |
| MAR-HToken Type=Continuous Tokens, Train Tokens=262B, Infer Tokens=256, #Params=943M2026.02 | 303.7 | — | — | — | 81 | 62 | 1.55 | — | — | — | — | — | — | — | — | — | — | — | |
| MAR-HTokenizer=Continuous, Params=943M, Steps=2562025.03 | 303.7 | — | — | — | 81 | 62 | 1.55 | — | — | — | — | — | — | — | 2 | — | — | — | |
| MAR-HArchitecture=MAR, Scale=H2026.03 | 303.7 | — | — | — | — | — | 1.55 | — | — | — | — | — | — | — | — | 9.97 | 1 | — | |
| MAR-HLiType=Bi-directional AR, #Para.=943M, Steps=2562025.04 | 303.7 | — | — | — | 81 | 0.62 | 1.55 | — | — | — | — | — | — | — | — | — | — | — | |
| MAREpochs=800, #Params=943M, Model Space=Latent Autoregressive, Guidance=w/ guidance2026.05 | 303.7 | — | — | — | 81 | 62 | — | — | — | — | — | — | — | 1.55 | — | — | — | 0.53 | |
| JiT-H/16Type=Pixel, Epochs=600, Sampler=Heun, Steps=50, CFG=Enabled2026.02 | 303.4 | — | — | — | 78 | 62 | 1.86 | — | — | — | — | — | — | — | — | — | — | — | |
| DeCo-XL/16Type=Pixel, Epochs=320, CFG=Enabled2026.02 | 303 | — | — | — | 80 | 61 | 1.9 | — | — | — | — | — | — | — | — | — | — | — | |
| REPA-EEpochs=800, #Params=675M, Model Space=Latent Diffusion, Guidance=w/ guidance2026.05 | 302.9 | — | — | — | 79 | 66 | — | — | — | — | — | — | — | 1.12 | — | — | — | 0.28 | |
| REPA-EEpochs=800, Params=675M, CFG=true2026.06 | 302.9 | — | — | — | 79 | 66 | — | 4.09 | — | — | — | — | — | 1.12 | — | — | — | — | |
| VAR-d20Params.=600M, Rejection sampling=false, Resolution=256x2562024.10 | 302.6 | — | — | — | 83 | 56 | 2.57 | — | — | — | — | — | — | — | — | — | — | — | |
| VAR-d20Type=VAR, #Para.=600M2024.09 | 302.6 | — | — | — | 83 | 56 | 2.57 | — | — | — | — | — | — | — | — | — | — | — | |
| VAR-d20Token Type=Discrete Tokens, Train Tokens=82M, Infer Tokens=256, #Params=600M2026.02 | 302.6 | — | — | — | 83 | 56 | 2.57 | — | — | — | — | — | — | — | — | — | — | — | |
| VAR-d20Family=Masked & AR, Steps=10, #Params=600M2025.09 | 302.6 | — | — | — | 83 | 56 | 2.57 | — | — | — | — | — | — | — | — | — | — | — | |
| VARType=Causal AR, #Para.=600M, Steps=102025.04 | 302.6 | — | — | — | 83 | 0.56 | 2.57 | — | — | — | — | — | — | — | — | — | — | — | |
| xAREpochs=800, #Params=1.1B, Model Space=Latent Autoregressive, Guidance=w/ guidance2026.05 | 301.6 | — | — | — | 83 | 64 | — | — | — | — | — | — | — | 1.24 | — | — | — | 0.53 | |
| MAR-H + DMDArchitecture=MAR, Scale=H, Acceleration=DMD2026.03 | 301 | — | — | — | — | — | 1.73 | — | — | — | — | — | — | — | — | 4.17 | 2.39 | — | |
| FAR-HTokenizer=Continuous, Params=812M, Steps=102025.03 | 300.6 | — | — | — | 81 | 55 | 3.21 | — | — | — | — | — | — | — | 2 | — | — | — | |
| Heun-SolverNumber of Function Evaluations (NFE)=102026.01 | 299.93 | — | — | — | 81 | 56 | 2.96 | 5.61 | — | — | — | — | — | — | — | — | — | — | |
| RAR-LToken Type=Discrete Tokens, Train Tokens=131M, Infer Tokens=256, #Params=461M2026.02 | 299.5 | — | — | — | 81 | 60 | 1.7 | — | — | — | — | — | — | — | — | — | — | — | |
| RAR-LType=Causal AR, #Para.=461M, Steps=2562025.04 | 299.5 | — | — | — | 81 | 0.6 | 1.7 | — | — | — | — | — | — | — | — | — | — | — | |
| MAR-H + LazyMARArchitecture=MAR, Scale=H, Acceleration=LazyMAR2026.03 | 299.2 | — | — | — | — | — | 1.69 | — | — | — | — | — | — | — | — | 4.24 | 2.35 | — | |
| TransDiff-H + Drift-ARArchitecture=TransDiff, Scale=H, Acceleration=Drift-AR, NFE=12026.03 | 298.1 | — | — | — | — | — | 1.57 | — | — | — | — | — | — | — | — | 1.33 | 5.06 | — | |
| PixNerd-XL/16Type=Pixel, Epochs=320, CFG=Enabled2026.02 | 298 | — | — | — | 80 | 60 | 1.95 | — | — | — | — | — | — | — | — | — | — | — | |
| TransDiff-HArchitecture=TransDiff, Scale=H2026.03 | 297.9 | — | — | — | — | — | 1.55 | — | — | — | — | — | — | — | — | 6.72 | 1 | — |