Class-conditional Image Generation on ImageNet 1k (val)
1.13FIDGAE
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| GAE# Params=675M, NFE=250 × 22026.05 | 1.13 | — | 294.9 | 0.79 | 0.67 | 0.053 | |
| RAE + DiT-XL# Params=839M, NFE=50 × 22026.05 | 1.13 | — | 262.6 | 0.78 | 0.67 | 0.169 | |
| REPA-E# Params=675M, NFE=250 × 22026.05 | 1.15 | — | 304 | 0.79 | 0.66 | 0.115 | |
| LightningDiT-XL/2# Params=675M, NFE=250 × 22026.05 | 1.35 | — | 295.3 | 0.79 | 0.65 | 0.139 | |
| SiT-XL/2 + REG# Params=675M, NFE=250 × 22026.05 | 1.36 | — | 299.4 | 0.77 | 0.66 | 0.228 | |
| RAR-XLType=Advanced Causal AR, #Para.=1.5B, #Tokens=256, Resolution=256x2562026.01 | 1.48 | — | 326 | 0.8 | 0.63 | — | |
| RAR-XXLType=Advanced Causal AR, #Para.=955M, #Tokens=256, Resolution=256x2562026.01 | 1.5 | — | 306.9 | 0.8 | 0.62 | — | |
| MAR-HType=Bi-directional AR, #Para.=943M, #Tokens=256, Resolution=256x2562026.01 | 1.55 | — | 303.7 | 0.81 | 0.62 | — | |
| iMF-XL/2# Params=610M, NFE=12026.05 | 1.72 | — | 282 | 0.78 | 0.62 | 0.384 | |
| LlamaGen-STAT-3BType=Vanilla Causal AR, #Para.=3.1B, #Tokens=229, Resolution=256x2562026.01 | 1.75 | — | 300.6 | 0.8 | 0.64 | — | |
| MAGVIT-v2Type=Bi-directional AR, #Para.=307M, #Tokens=256, Resolution=256x2562026.01 | 1.78 | — | 319.4 | — | — | — | |
| Oracle (Val data)rejection sampling=false2025.12 | 1.78 | — | 236.9 | 0.75 | 0.67 | — | |
| ∞-CC+Λ24-SQrejection sampling=false, # Params=2.8B (0.4B), Steps=72025.12 | 1.82 | — | 333.4 | 0.78 | 0.64 | — | |
| LlamaGen-STAT-XXLType=Vanilla Causal AR, #Para.=1.4B, #Tokens=227, Resolution=256x2562026.01 | 1.91 | — | 290.2 | 0.79 | 0.63 | — | |
| VAR (2.0B)Type=Advanced Causal AR, #Para.=2.0B, #Tokens=680, Resolution=256x2562026.01 | 1.92 | — | 350.2 | 0.82 | 0.59 | — | |
| VAR-d30rejection sampling=false, # Params=2.0B, Steps=102025.12 | 1.92 | — | 323.1 | 0.82 | 0.59 | — | |
| TiTok-S-128Type=Bi-directional AR, #Para.=287M, #Tokens=128, Resolution=256x2562026.01 | 1.97 | — | 281.8 | — | — | — | |
| MAR-LType=Bi-directional AR, #Para.=479M, #Tokens=64, Resolution=256x2562026.01 | 1.98 | — | 290.3 | — | — | — | |
| SiT-XLType=Diffusion, #Para.=675M, #Tokens=250, Resolution=256x2562026.01 | 2.06 | — | 270.3 | 0.82 | 0.59 | — | |
| VAR-d24rejection sampling=false, # Params=1.0B, Steps=102025.12 | 2.09 | — | 312.9 | 0.82 | 0.59 | — | |
| Ours-XL/1# Params=675M, NFE=6 × 22026.05 | 2.11 | — | 293.8 | 0.78 | 0.62 | 0.147 | |
| RandAR-XXLType=Advanced Causal AR, #Para.=1.4B, #Tokens=256, Resolution=256x2562026.01 | 2.15 | — | 322 | 0.79 | 0.62 | — | |
| LlamaGen-3B-576Type=Vanilla Causal AR, #Para.=3.1B, #Tokens=576, Resolution=256x2562026.01 | 2.18 | — | 263.3 | 0.81 | 0.58 | — | |
| ∞-CC+Λ24-SQrejection sampling=false, # Params=1.0B (0.3B), Steps=72025.12 | 2.18 | — | 332.3 | 0.78 | 0.63 | — | |
| RandAR-XLType=Advanced Causal AR, #Para.=775M, #Tokens=256, Resolution=256x2562026.01 | 2.25 | — | 317.8 | 0.8 | 0.6 | — | |
| Ours-XL/1# Params=675M, NFE=4 × 22026.05 | 2.25 | — | 308.5 | 0.78 | 0.61 | 0.144 | |
| DiT-XLType=Diffusion, #Para.=675M, #Tokens=250, Resolution=256x2562026.01 | 2.27 | — | 278.2 | 0.83 | 0.57 | — | |
| LlamaGen-XXL + VA-πBackbone=LlamaGen-XXL (1.4B), External Reward=false, Training Time (min)=25, Classifier-free guidance (CFG)=true2025.12 | 2.28 | — | 273.53 | 0.83 | 0.56 | — | |
| StyleGAN-XLType=GAN, #Para.=166M, #Tokens=1, Resolution=256x2562026.01 | 2.3 | — | 265.1 | 0.78 | 0.53 | — | |
| DDPMBackbone=DiT-XL/2, Sampling Steps=250, Latency(s)=49.564, FLOPs(T)=118.682025.12 | 2.31 | 4.98 | 243.42 | 0.82 | 0.58 | — | |
| Open-MAGVIT-v2-XLType=Vanilla Causal AR, #Para.=1.5B, #Tokens=256, Resolution=256x2562026.01 | 2.33 | — | 271.8 | 0.84 | 0.54 | — | |
| LlamaGen-XXL-576Type=Vanilla Causal AR, #Para.=1.4B, #Tokens=576, Resolution=256x2562026.01 | 2.34 | — | 253.9 | 0.8 | 0.59 | — | |
| LlamaGen-STAT-XLType=Vanilla Causal AR, #Para.=775M, #Tokens=223, Resolution=256x2562026.01 | 2.36 | — | 244 | 0.78 | 0.62 | — | |
| LlamaGen-XXL (1.4B)Backbone=LlamaGen-XXL (1.4B), Classifier-free guidance (CFG)=true2025.12 | 2.37 | — | 252.16 | 0.81 | 0.59 | — | |
| DDIMBackbone=DiT-XL/2, Sampling Steps=50, Latency(s)=4.549, FLOPs(T)=23.74, Speed=1.00x2025.12 | 2.43 | 4.4 | 241.25 | 0.8 | 0.59 | — | |
| VAR (600M)Type=Advanced Causal AR, #Para.=600M, #Tokens=680, Resolution=256x2562026.01 | 2.57 | — | 302.6 | 0.83 | 0.56 | — | |
| α-Flow-XL/2+# Params=676M, NFE=12026.05 | 2.58 | — | 242.4 | 0.76 | 0.61 | 0.52 | |
| LlamaGen-XL-576Type=Vanilla Causal AR, #Para.=775M, #Tokens=576, Resolution=256x2562026.01 | 2.62 | — | 244.1 | 0.8 | 0.57 | — | |
| LlamaGen-XXL + Post-train TokenizerBackbone=LlamaGen-XXL (1.4B), External Reward=false, Training Time (min)=18, Classifier-free guidance (CFG)=true2025.12 | 2.72 | — | 246.97 | 0.8 | 0.59 | — | |
| SAR-XLType=Advanced Causal AR, #Para.=893M, #Tokens=256, Resolution=256x2562026.01 | 2.76 | — | 273.8 | 0.84 | 0.55 | — | |
| LlamaGen-XL (775M)Backbone=LlamaGen-XL (775M), Classifier-free guidance (CFG)=true2025.12 | 2.79 | — | 286.88 | 0.84 | 0.54 | — | |
| LlamaGen-XL + VA-πBackbone=LlamaGen-XL (775M), External Reward=false, Training Time (min)=20, Classifier-free guidance (CFG)=true2025.12 | 2.94 | — | 299.63 | 0.84 | 0.53 | — | |
| ProCacheBackbone=DiT-XL/2, Latency(s)=1.725, FLOPs(T)=8.18, Speed=2.90x2025.12 | 2.96 | 4.93 | 232.85 | 0.8 | 0.57 | — | |
| ToCaBackbone=DiT-XL/2, N (Hyperparameter)=3, Latency(s)=2.087, FLOPs(T)=10.23, Speed=2.32x2025.12 | 3.04 | 5.14 | 230.7 | 0.79 | 0.56 | — | |
| VIMrejection sampling=true, # Params=1.7B, Steps=10242025.12 | 3.04 | — | 227.4 | — | — | — | |
| LlamaGenrejection sampling=false, # Params=3.1B, Steps=2562025.12 | 3.05 | — | 222.3 | 0.8 | 0.58 | — | |
| LlamaGen-3B-256Type=Vanilla Causal AR, #Para.=3.1B, #Tokens=576, Resolution=256x2562026.01 | 3.06 | — | 279.7 | 0.84 | 0.54 | — | |
| LlamaGen-XXL-256Type=Vanilla Causal AR, #Para.=1.4B, #Tokens=576, Resolution=256x2562026.01 | 3.09 | — | 253.6 | 0.82 | 0.53 | — | |
| DDIMBackbone=DiT-XL/2, Sampling Steps=25, Latency(s)=2.263, FLOPs(T)=11.87, Speed=2.00x2025.12 | 3.18 | 4.74 | 232.01 | 0.79 | 0.58 | — | |
| LlamaGen-XL-256Type=Vanilla Causal AR, #Para.=775M, #Tokens=256, Resolution=256x2562026.01 | 3.39 | — | 227.1 | 0.81 | 0.54 | — | |
| MeanFlow-XL/2# Params=676M, NFE=12026.05 | 3.43 | — | 216.4 | 0.75 | 0.59 | 0.575 | |
| GigaGANType=GAN, #Para.=569M, #Tokens=1, Resolution=256x2562026.01 | 3.45 | — | 225.5 | 0.84 | 0.61 | — | |
| LDM-4Type=Diffusion, #Para.=400M, #Tokens=250, Resolution=256x2562026.01 | 3.6 | — | 247.7 | — | — | — | |
| LlamaGen-XL + AR-GRPOBackbone=LlamaGen-XL (775M), External Reward=true, Training Time (min)=149, Classifier-free guidance (CFG)=true2025.12 | 3.63 | — | 293.07 | 0.86 | 0.48 | — | |
| ToCaBackbone=DiT-XL/2, N (Hyperparameter)=4, Latency(s)=2.063, FLOPs(T)=8.73, Speed=2.72x2025.12 | 3.64 | 5.55 | 223.25 | 0.78 | 0.56 | — | |
| Delta-DiTBackbone=DiT-XL/2, N (Hyperparameter)=3, Latency(s)=2.572, FLOPs(T)=16.46, Speed=1.47x2025.12 | 3.75 | 5.7 | 207.57 | 0.77 | 0.54 | — | |
| RQTran.-reType=Vanilla Causal AR, #Para.=3.8B, #Tokens=256, Resolution=256x2562026.01 | 3.8 | — | 323.7 | — | — | — | |
| RQ-TFrejection sampling=true, # Params=3.8B, Steps=682025.12 | 3.8 | — | 323.7 | — | — | — | |
| DDIMBackbone=DiT-XL/2, Sampling Steps=20, Latency(s)=1.862, FLOPs(T)=9.49, Speed=2.50x2025.12 | 3.81 | 5.15 | 221.43 | 0.78 | 0.58 | — | |
| FORABackbone=DiT-XL/2, N (Hyperparameter)=3, Latency(s)=2.191, FLOPs(T)=8.59, Speed=2.76x2025.12 | 3.88 | 6.43 | 229.02 | 0.79 | 0.54 | — | |
| MaskGIT-reType=Bi-directional AR, #Para.=227M, #Tokens=256, Resolution=256x2562026.01 | 4.02 | — | 355.6 | — | — | — | |
| Sphere Encoder# Params=1.3B, NFE=4 × 22026.05 | 4.02 | — | 265.9 | 0.78 | 0.58 | 0.363 | |
| LlamaGen-XXL + STE based Post-train ARBackbone=LlamaGen-XXL (1.4B), External Reward=false, Training Time (min)=381, Classifier-free guidance (CFG)=true2025.12 | 4.17 | — | 267.34 | 0.83 | 0.51 | — | |
| LlamaGen-XXL + Post-train Tokenizer (longer)Backbone=LlamaGen-XXL (1.4B), External Reward=false, Training Time (min)=207, Classifier-free guidance (CFG)=true2025.12 | 4.31 | — | 221.57 | 0.75 | 0.58 | — | |
| DDIMBackbone=DiT-XL/2, Sampling Steps=17, Latency(s)=1.563, FLOPs(T)=8.07, Speed=2.94x2025.12 | 4.58 | 5.76 | 208.72 | 0.77 | 0.56 | — | |
| ADMType=Diffusion, #Para.=554M, #Tokens=250, Resolution=256x2562026.01 | 4.59 | — | 186.7 | 0.82 | 0.53 | — | |
| VQGANType=Vanilla Causal AR, #Para.=1.4B, #Tokens=256, Resolution=256x2562026.01 | 5.2 | — | 280.3 | — | — | — | |
| VQGANrejection sampling=true, # Params=1.4B, Steps=2562025.12 | 5.2 | — | 280.3 | — | — | — | |
| BigGANType=GAN, #Para.=112M, #Tokens=1, Resolution=256x2562026.01 | 6.95 | — | 224.5 | 0.89 | 0.38 | — | |
| LlamaGen-XXL + VA-πBackbone=LlamaGen-XXL (1.4B), External Reward=false, Training Time (min)=25, Classifier-free guidance (CFG)=false2025.12 | 7.65 | — | 116.7 | 0.71 | 0.64 | — | |
| LlamaGen-XL + VA-πBackbone=LlamaGen-XL (775M), External Reward=false, Training Time (min)=20, Classifier-free guidance (CFG)=false2025.12 | 9.23 | — | 111.59 | 0.71 | 0.59 | — | |
| LlamaGen-XXL + STE based Post-train ARBackbone=LlamaGen-XXL (1.4B), External Reward=false, Training Time (min)=381, Classifier-free guidance (CFG)=false2025.12 | 11.46 | — | 102.21 | 0.68 | 0.61 | — | |
| LlamaGen-XXL + Post-train TokenizerBackbone=LlamaGen-XXL (1.4B), External Reward=false, Training Time (min)=18, Classifier-free guidance (CFG)=false2025.12 | 14.26 | — | 86.7 | 0.63 | 0.68 | — | |
| LlamaGen-XXL (1.4B)Backbone=LlamaGen-XXL (1.4B), Classifier-free guidance (CFG)=false2025.12 | 14.36 | — | 86.55 | 0.63 | 0.69 | — | |
| LlamaGen-XL (775M)Backbone=LlamaGen-XL (775M), Classifier-free guidance (CFG)=false2025.12 | 15.55 | — | 79.16 | 0.62 | 0.69 | — | |
| LlamaGen-XXL + Post-train Tokenizer (longer)Backbone=LlamaGen-XXL (1.4B), External Reward=false, Training Time (min)=207, Classifier-free guidance (CFG)=false2025.12 | 22.99 | — | 72.49 | 0.56 | 0.68 | — | |
| SD VAEAutoencoder=SD VAE, Latents=32×32×42026.01 | 23.05 | 68.65 | 70.34 | 0.4318 | 0.4775 | — | |
| HUVRAutoencoder=Ours, Latents=16×256×2562026.01 | 24.53 | 68.37 | 66.13 | 0.4307 | 0.4367 | — | |
| HUVRAutoencoder=Ours, Latents=16×16×162026.01 | 24.72 | 76.09 | 60.17 | 0.385 | 0.4645 | — |