Image Generation on ImageNet 1K (train)
4.81FIDVQGAN-LC
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| VQGAN-LCBackbone=LDM, # Tokens=1,024, Codebook Size=100,0002024.06 | 4.81 | — | 99.4 | — | — | — | |
| DQTransformer (GPT-655M)# Tokens=640, Codebook Size=1,0242024.06 | 5.11 | — | — | — | — | — | |
| Stackformer (GPT-651M)# Tokens=1,024, Codebook Size=1,0242024.06 | 6.04 | — | — | — | — | — | |
| DQTransformer (GPT-355M)# Tokens=640, Codebook Size=1,0242024.06 | 7.34 | — | — | — | — | — | |
| LDM# Tokens=1,024, Codebook Size=16,3842024.06 | 8.11 | — | — | — | — | — | |
| VQGAN-LCBackbone=LDM, # Tokens=256, Codebook Size=100,0002024.06 | 8.36 | — | 99.4 | — | — | — | |
| VQGAN-LCBackbone=SiT-XL, # Tokens=256, Codebook Size=100,0002024.06 | 8.4 | — | 99.6 | — | — | — | |
| ViT-VQGAN (GPT-650M)# Tokens=1,024, Codebook Size=8,1922024.06 | 8.81 | — | — | — | — | — | |
| VQGAN-EMABackbone=LDM, # Tokens=256, Codebook Size=16,3842024.06 | 9.13 | — | 83.1 | — | — | — | |
| VQGAN-EMABackbone=SiT-XL, # Tokens=256, Codebook Size=16,3842024.06 | 9.31 | — | 83.1 | — | — | — | |
| VQGAN-FCBackbone=LDM, # Tokens=256, Codebook Size=16,3842024.06 | 9.78 | — | 11.2 | — | — | — | |
| RACBackbone=VA-VAE, Training Strategy=RAC, DeltaParams=-40.7%2026.03 | 9.8 | 91.4 | — | 5.08 | 73 | 62 | |
| VQGAN-FCBackbone=SiT-XL, # Tokens=256, Codebook Size=16,3842024.06 | 10.3 | — | 11.2 | — | — | — | |
| VQGAN-LCBackbone=DiT-XL, # Tokens=256, Codebook Size=100,0002024.06 | 10.8 | — | 99.4 | — | — | — | |
| REPA-EBackbone=VA-VAE, Training Strategy=REPA-E, DeltaParams=0.0%2026.03 | 11.1 | 88.8 | — | 5.31 | 72 | 61 | |
| ViT-VQGAN (GPT-650M)# Tokens=256, Codebook Size=8,1922024.06 | 11.2 | — | — | — | — | — | |
| RACBackbone=IN-VAE, Training Strategy=RAC, DeltaParams=-40.7%2026.03 | 11.2 | 87.5 | — | 5.21 | 71 | 63 | |
| REPA-EBackbone=IN-VAE, Training Strategy=REPA-E, DeltaParams=0.0%2026.03 | 12.7 | 84 | — | 5.57 | 69 | 62 | |
| VA-VAEBackbone=VA-VAE, Training Strategy=Vanilla, DeltaParams=0.0%2026.03 | 12.8 | 83.8 | — | 6.47 | 71 | 58 | |
| VQGAN-EMABackbone=DiT-XL, # Tokens=256, Codebook Size=16,3842024.06 | 13.4 | — | 85.3 | — | — | — | |
| VQGAN-FCBackbone=DiT-XL, # Tokens=256, Codebook Size=16,3842024.06 | 13.7 | — | 11.2 | — | — | — | |
| RACBackbone=SD-VAE, Training Strategy=RAC, DeltaParams=-40.8%2026.03 | 14.8 | 78.3 | — | 5.43 | 70 | 61 | |
| VQGAN-LCBackbone=GPT-404M, # Tokens=256, Codebook Size=100,0002024.06 | 15.4 | — | 97 | — | — | — | |
| RQTransformer (GPT-480M)# Tokens=256, Codebook Size=16,3842024.06 | 15.7 | — | — | — | — | — | |
| VQGAN-EMABackbone=GPT-404M, # Tokens=256, Codebook Size=16,3842024.06 | 16.3 | — | 83.1 | — | — | — | |
| REPA-EBackbone=SD-VAE, Training Strategy=REPA-E, DeltaParams=0.0%2026.03 | 16.3 | 75 | — | 5.69 | 68 | 60 | |
| VQGAN-FCBackbone=GPT-404M, # Tokens=256, Codebook Size=16,3842024.06 | 17.3 | — | 11.2 | — | — | — | |
| IN-VAEBackbone=IN-VAE, Training Strategy=Vanilla, DeltaParams=0.0%2026.03 | 22.7 | 56 | — | 5.47 | 62 | 62 | |
| SD-VAEBackbone=SD-VAE, Training Strategy=Vanilla, DeltaParams=0.0%2026.03 | 24.1 | 55.7 | — | 6.25 | 62 | 60 | |
| MaxViTNumber of Parameters=18.6M2022.04 | 30.77 | 22.58 | — | — | — | — | |
| HiTNumber of Parameters=32.9M2022.04 | 30.83 | 21.64 | — | — | — | — | |
| ConvNet-R12022.04 | 37.18 | 19.55 | — | — | — | — | |
| LogoGANPre-trained classifier usage=true2022.04 | 38.41 | 18.86 | — | — | — | — | |
| SC GAN2022.04 | 40.3 | 15.82 | — | — | — | — | |
| SS-GAN2022.04 | 43.87 | — | — | — | — | — | |
| MGAN2022.04 | 50.9 | 14.44 | — | — | — | — | |
| GAN2022.04 | 54.17 | 14.01 | — | — | — | — | |
| PacGAN22022.04 | 57.51 | 13.5 | — | — | — | — |