Image Generation on ImageNet 512x512 (test/val)
1.85FIDEDM2-XL
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| EDM2-XLTraining Paradigm=Diffusion/Flow, NFE=63×2, # Params=1.1B2025.11 | 1.85 | — | — | — | — | |
| EDM2-LTraining Paradigm=Diffusion/Flow, NFE=63×2, # Params=778M2025.11 | 1.88 | — | — | — | — | |
| SiT-XL/2 + REPATraining Steps=1M, Guidance=Classifier-free Guidance (CFG), Alignment=representation alignment with external encoder2026.07 | 2.08 | 4.19 | 0.83 | 0.58 | 274.6 | |
| SiT-XL/2 + oursTraining Steps=1M, Guidance=Classifier-free Guidance (CFG), Alignment=self-representation alignment2026.07 | 2.08 | 4.12 | 0.83 | 0.58 | 282.7 | |
| SiT-XL/2 + Self-FlowTraining Steps=1M, Guidance=Classifier-free Guidance (CFG), Alignment=self-representation alignment2026.07 | 2.12 | 4.1 | 0.83 | 0.58 | 280.2 | |
| SiT-XL/2 + SRATraining Steps=1M, Guidance=Classifier-free Guidance (CFG), Alignment=self-representation alignment2026.07 | 2.17 | 4.15 | 0.83 | 0.59 | 279.3 | |
| SiT-XL/2 + AHPAType=Latent diffusion, Transformer, Epochs=100, CFG=true2026.05 | 2.28 | 4.16 | 0.84 | 0.56 | 261.4 | |
| SiT-XL/2 + REPAType=Latent diffusion, Transformer, Epochs=100, CFG=true2026.05 | 2.37 | 4.2 | 0.83 | 0.56 | 253.7 | |
| SiT-XL/2 + SRA 2Type=Latent diffusion, Transformer, Epochs=100, CFG=true2026.05 | 2.45 | 4.28 | 0.83 | 0.55 | 249.1 | |
| MaskDiTType=Latent diffusion, Transformer, Epochs=800, CFG=true2026.05 | 2.5 | 5.1 | 0.83 | 0.56 | 256.3 | |
| SiT-XL/2Training Paradigm=Diffusion/Flow, Classifier-Free Guidance (w)=1.5, NFE=250×2, # Params=675M2025.11 | 2.62 | — | — | — | — | |
| SiT-XL/2Type=Latent diffusion, Transformer, Epochs=600, CFG=true2026.05 | 2.62 | 4.18 | 0.84 | 0.57 | 252.2 | |
| SiT-XL/2Training Steps=3M, Guidance=Classifier-free Guidance (CFG)2026.07 | 2.62 | 4.18 | 0.84 | 0.57 | 252.2 | |
| VDM++Training Paradigm=Diffusion/Flow, NFE=512×2, # Params=2B2025.11 | 2.65 | — | — | — | — | |
| VDM++Type=Pixel diffusion, CFG=true2026.05 | 2.65 | — | — | — | 278.1 | |
| ADM-G, ADM-UType=Pixel diffusion, Epochs=400, CFG=true2026.05 | 2.85 | 5.86 | 0.84 | 0.53 | 221.7 | |
| TVM-XL/2Training Paradigm=One/Few-Step from Scratch, Classifier-Free Guidance (w)=2.25, NFE=4, # Params=678M2025.11 | 2.94 | — | — | — | — | |
| SimDiffTraining Paradigm=Diffusion/Flow, NFE=512×2, # Params=2B2025.11 | 3.02 | — | — | — | — | |
| DiT-XL/2Training Paradigm=Diffusion/Flow, Classifier-Free Guidance (w)=1.5, NFE=250×2, # Params=675M2025.11 | 3.04 | — | — | — | — | |
| DiT-XL/2Type=Latent diffusion, Transformer, Epochs=600, CFG=true2026.05 | 3.04 | 5.02 | 0.84 | 0.54 | 240.8 | |
| DiT-XL/2Training Steps=3M, Guidance=Classifier-free Guidance (CFG)2026.07 | 3.04 | 5.02 | 0.84 | 0.54 | 240.8 | |
| MeanFlow-XL/2Training Paradigm=One/Few-Step from Scratch, NFE=2, # Params=676M2025.11 | 3.17 | — | — | — | — | |
| TVM-XL/2Training Paradigm=One/Few-Step from Scratch, Classifier-Free Guidance (w)=2.5, NFE=2, # Params=678M2025.11 | 3.5 | — | — | — | — | |
| sCT-XLTraining Paradigm=One/Few-Step from Scratch, NFE=2, # Params=1.1B2025.11 | 3.73 | — | — | — | — | |
| ADM-G, ADM-UADM-G Iterations=4360K, ADM-U Iterations=1050K, Generator Compute (V100-days)=1878, Classifier Compute (V100-days)=36, Total Compute (V100-days)=19142021.05 | 3.85 | 5.86 | 0.84 | 0.53 | — | |
| TVM-XL/2Training Paradigm=One/Few-Step from Scratch, Classifier-Free Guidance (w)=2.25, NFE=2, # Params=678M2025.11 | 3.89 | — | — | — | — | |
| U-ViT-H/4Training Paradigm=Diffusion/Flow, NFE=250×2, # Params=501M2025.11 | 4.05 | — | — | — | — | |
| Simple diffusion (U-Net)Type=Pixel diffusion, Epochs=800, CFG=true2026.05 | 4.28 | — | — | — | 171 | |
| TVM-XL/2Training Paradigm=One/Few-Step from Scratch, Classifier-Free Guidance (w)=2.5, NFE=1, # Params=678M2025.11 | 4.32 | — | — | — | — | |
| sCT-XLTraining Paradigm=One/Few-Step from Scratch, NFE=1, # Params=1.1B2025.11 | 4.33 | — | — | — | — | |
| Simple diffusion (U-ViT, L)Type=Pixel diffusion, Epochs=800, CFG=true2026.05 | 4.53 | — | — | — | 205.3 | |
| DiT-XL/2Training Paradigm=Diffusion/Flow, Classifier-Free Guidance (w)=1.25, NFE=250×2, # Params=675M2025.11 | 4.64 | — | — | — | — | |
| sCT-LTraining Paradigm=One/Few-Step from Scratch, NFE=2, # Params=778M2025.11 | 4.65 | — | — | — | — | |
| sCT-LTraining Paradigm=One/Few-Step from Scratch, NFE=1, # Params=778M2025.11 | 5.15 | — | — | — | — | |
| MeanFlow-XL/2Training Paradigm=One/Few-Step from Scratch, NFE=1, # Params=676M2025.11 | 5.24 | — | — | — | — | |
| TVM-XL/2Training Paradigm=One/Few-Step from Scratch, Classifier-Free Guidance (w)=2.25, NFE=1, # Params=678M2025.11 | 5.37 | — | — | — | — | |
| ADM-G, ADM-UADM-G Iterations=500K, ADM-U Iterations=100K, Generator Compute (V100-days)=189, Classifier Compute (V100-days)=9, Total Compute (V100-days)=198, Classifier config=ImageNet 128x128 classifier with batch size 2562021.05 | 7.59 | 6.84 | 0.84 | 0.53 | — | |
| ADM-GTraining Paradigm=Diffusion/Flow, NFE=250×2, # Params=559M2025.11 | 7.72 | — | — | — | — | |
| BigGAN-deepTotal Compute (V100-days)=256-5122021.05 | 8.43 | 8.13 | 0.88 | 0.29 | — |