Text-to-image Generation on MS-COCO
4.52FIDMMDiT + AHPA
Evaluation Results
| Method | Links | ||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| MMDiT + AHPABackbone=MMDiT, Sampling method=SDE, NFE=2502026.05 | 4.52 | — | — | — | — | — | — | — | — | — | — | — | — | 21.33 | — | — | — | — | — | — | |
| SSCBackbone=MMDiT, Training Objective=REPA, NFE=50, CFG=1.02026.05 | 4.71 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MMDiT + REPABackbone=MMDiT, Sampling method=SDE, NFE=2502026.05 | 4.74 | — | — | — | — | — | — | — | — | — | — | — | — | 20.9 | — | — | — | — | — | — | |
| MMDiT + SRA 2Backbone=MMDiT, Sampling method=SDE, NFE=2502026.05 | 4.91 | — | — | — | — | — | — | — | — | — | — | — | — | 20.76 | — | — | — | — | — | — | |
| U-ViT + C2FGGuidance Scale (omega_0)=2, Guidance Scale (lambda)=0.2, Evaluation Space=Latent Space2026.03 | 5.28 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MMDiTBackbone=MMDiT, Sampling method=SDE, NFE=2502026.05 | 5.3 | — | — | — | — | — | — | — | — | — | — | — | — | 20.54 | — | — | — | — | — | — | |
| U-ViTGuidance Scale (omega)=2, Evaluation Space=Latent Space2026.03 | 5.37 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MMDiT + REPABackbone=MMDiT, Training Objective=REPA, NFE=50, CFG=1.02026.05 | 6.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SDXLSteps=50, #Params=2.6B2025.09 | 6.63 | — | — | — | — | — | — | — | — | — | 0.29 | — | — | — | — | — | — | — | — | — | |
| PartiTraining Protocol=Trained directly on paired text/image data2023.04 | 7.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Imagenmodel_category=T2I Models, parameters=3.4B2023.10 | 7.27 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ImagenTraining Protocol=Trained directly on paired text/image data2023.04 | 7.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LaVITType=LLM (Disc.), Decoder=SDv1.5, Zero-shot=true2024.06 | 7.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastCacheModel=DeepFloyd T2I2025.05 | 7.7 | — | — | — | — | — | — | — | — | — | 27.4 | 13,012 | 30.1 | — | — | — | — | — | — | — | |
| AdaCacheModel=DeepFloyd T2I2025.05 | 7.82 | — | — | — | — | — | — | — | — | — | 27.2 | 15,120 | 18.9 | — | — | — | — | — | — | — | |
| FBCacheModel=DeepFloyd T2I2025.05 | 7.89 | — | — | — | — | — | — | — | — | — | 27 | 13,980 | 24.9 | — | — | — | — | — | — | — | |
| TeaCacheModel=DeepFloyd T2I2025.05 | 8.05 | — | — | — | — | — | — | — | — | — | 26.7 | 14,510 | 22.2 | — | — | — | — | — | — | — | |
| LAFITE2021.11 | 8.12 | 32.34 | — | — | — | — | — | 61.09 | 74.78 | — | — | — | — | — | — | — | — | — | — | — | |
| SiD-LSG†Steps=1, #Params=0.9B2025.09 | 8.15 | — | — | — | — | — | — | — | — | — | 0.304 | — | — | — | — | — | — | — | — | — | |
| SETOKIMType=LLM (Cont.), Decoder=SeTok, Zero-shot=true2024.06 | 8.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DreamLLMType=LLM (Cont.), Decoder=SDv2.1, Zero-shot=true2024.06 | 8.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SD v2.1Type=Diffusion, Zero-shot=true2024.06 | 9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| XMC-GAN2021.11 | 9.33 | 30.45 | — | — | — | — | — | 50.94 | 71.33 | — | — | — | — | — | — | — | — | — | — | — | |
| SD v1.5model_category=T2I Models, evaluated_by_authors=true2023.10 | 9.34 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FLUIDzero-shot=true2026.03 | 9.62 | — | — | — | — | — | — | — | — | — | 30.7 | — | — | — | — | — | — | — | — | — | |
| Composer-ref. freereference-free=true2026.05 | 9.72 | — | — | — | — | — | — | — | — | — | 0.283 | — | — | — | 5.82 | — | — | — | — | — | |
| SD-v15-ftfine-tuned=true2026.05 | 9.88 | — | — | — | — | — | — | — | — | — | 0.273 | — | — | — | 5.52 | — | — | — | — | — | |
| SD-v152026.05 | 9.93 | — | — | — | — | — | — | — | — | — | 0.271 | — | — | — | 5.43 | — | — | — | — | — | |
| REPAzero-shot=true2026.03 | 10 | — | — | — | — | — | — | — | — | — | 30.7 | — | — | — | — | — | — | — | — | — | |
| StackformerModel Type=Autoregressive2023.05 | 10.08 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastCacheModel=Stable Diffusion 1.52025.05 | 10.23 | — | — | — | — | — | — | — | — | — | 26.7 | 10,921 | 33.5 | — | — | — | — | — | — | — | |
| Composer-XLscale=XL2026.05 | 10.25 | — | — | — | — | — | — | — | — | — | 0.298 | — | — | — | 6.02 | — | — | — | — | — | |
| CM3LeonType=LLM (Disc.), Decoder=VQGAN, Zero-shot=true2024.06 | 10.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdaCacheModel=Stable Diffusion 1.52025.05 | 10.34 | — | — | — | — | — | — | — | — | — | 26.4 | 12,970 | 21 | — | — | — | — | — | — | — | |
| DALL-E 2model_category=T2I Models2023.10 | 10.39 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DALLE 2Steps=-, #Params=4.2B2025.09 | 10.39 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DALL-E 2Training Protocol=Trained directly on paired text/image data2023.04 | 10.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DREAMzero-shot=true2026.03 | 10.4 | — | — | — | — | — | — | — | — | — | 31.5 | — | — | — | — | — | — | — | — | — | |
| FBCacheModel=Stable Diffusion 1.52025.05 | 10.41 | — | — | — | — | — | — | — | — | — | 26.3 | 11,772 | 28.3 | — | — | — | — | — | — | — | |
| TeaCacheModel=Stable Diffusion 1.52025.05 | 10.62 | — | — | — | — | — | — | — | — | — | 26 | 12,214 | 25.6 | — | — | — | — | — | — | — | |
| TRONTraining Protocol=Zero-shot (pre-trained models only), Backbone=StyleGAN-XL, CLIP version=LAION2B CLIP, Caption model=BLIP-22023.04 | 10.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LACON-AModel Scale=Qwen3-1.7B2026.03 | 10.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| KOSMOS-Gmodel_category=CLIP-Aligned VL2I Models, parameters=1.9B2023.10 | 10.99 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LACON-SModel Scale=Qwen3-1.7B2026.03 | 11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Composer2026.05 | 11.04 | — | — | — | — | — | — | — | — | — | 0.281 | — | — | — | 5.89 | — | — | — | — | — | |
| LACON-AModel Scale=Qwen3-0.6B2026.03 | 11.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoDi2023.12 | 11.26 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LACON-SModel Scale=Qwen3-0.6B2026.03 | 11.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Guidance CorrectionGuidance scale (w)=5.02025.10 | 11.53 | — | — | — | — | — | — | — | — | — | 0.313 | — | — | — | — | — | — | — | — | — | |
| Emu2023.12 | 11.66 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Emumodel_category=CLIP-Aligned VL2I Models, parameters=14B2023.10 | 11.66 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CFGGuidance scale (w)=5.02025.10 | 11.69 | — | — | — | — | — | — | — | — | — | 0.313 | — | — | — | — | — | — | — | — | — | |
| Make-A-SceneType=Autoregressive, Zero-shot=true2024.06 | 11.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Make-A-Scenemodel_category=T2I Models2023.10 | 11.84 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CFG++Guidance scale (w)=5.02025.10 | 11.87 | — | — | — | — | — | — | — | — | — | 0.313 | — | — | — | — | — | — | — | — | — | |
| Baseline-BModel Scale=Qwen3-1.7B2026.03 | 12.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIDETraining Protocol=Trained directly on paired text/image data2023.04 | 12.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GILLmodel_category=CLIP-Aligned VL2I Models, parameters=8B2023.10 | 12.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIDEmodel_category=T2I Models2023.10 | 12.24 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Baseline-BModel Scale=Qwen3-0.6B2026.03 | 12.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Latent DiffusionTraining Protocol=Trained directly on paired text/image data2023.04 | 12.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LWMType=LLM (Disc.), Decoder=VQGAN, Zero-shot=true2024.06 | 12.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LDMSteps=50, #Params=1.4B2025.09 | 12.64 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeMe (Before Merge)#Iterations=20K×42024.10 | 12.78 | — | — | — | — | — | — | — | — | — | 29.85 | — | — | — | — | — | — | — | — | — | |
| RPG2026.05 | 12.79 | — | — | — | — | — | — | — | — | — | 0.284 | — | — | — | 5.81 | — | — | — | — | — | |
| DeMe (After Merge)#Iterations=20K×42024.10 | 13.06 | — | — | — | — | — | — | — | — | — | 30.11 | — | — | — | — | — | — | — | — | — | |
| InstaFlowSteps=1, #Params=0.9B2025.09 | 13.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ANT-UW#Iterations=80K2024.10 | 13.17 | — | — | — | — | — | — | — | — | — | 29.94 | — | — | — | — | — | — | — | — | — | |
| P2 Weighting#Iterations=80K2024.10 | 13.23 | — | — | — | — | — | — | — | — | — | 29.93 | — | — | — | — | — | — | — | — | — | |
| UIO-2model_size=XXL2023.12 | 13.39 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ANT-NashMTL#Iterations=80K2024.10 | 13.39 | — | — | — | — | — | — | — | — | — | 29.81 | — | — | — | — | — | — | — | — | — | |
| Before-finetuning2024.10 | 13.42 | — | — | — | — | — | — | — | — | — | 29.88 | — | — | — | — | — | — | — | — | — | |
| RealCompo2026.05 | 13.57 | — | — | — | — | — | — | — | — | — | 0.279 | — | — | — | 5.72 | — | — | — | — | — | |
| Guidance CorrectionGuidance scale (w)=7.52025.10 | 13.81 | — | — | — | — | — | — | — | — | — | 0.314 | — | — | — | — | — | — | — | — | — | |
| StyleGAN-TTraining Protocol=Trained directly on paired text/image data2023.04 | 13.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SNR+1#Iterations=80K2024.10 | 13.92 | — | — | — | — | — | — | — | — | — | 29.96 | — | — | — | — | — | — | — | — | — | |
| Min-SNR-γ#Iterations=80K2024.10 | 13.92 | — | — | — | — | — | — | — | — | — | 29.93 | — | — | — | — | — | — | — | — | — | |
| Trun-SNR#Iterations=80K2024.10 | 13.93 | — | — | — | — | — | — | — | — | — | 29.95 | — | — | — | — | — | — | — | — | — | |
| CFG++Guidance scale (w)=7.52025.10 | 13.98 | — | — | — | — | — | — | — | — | — | 0.314 | — | — | — | — | — | — | — | — | — | |
| UIO-2model_size=XL2023.12 | 14.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CFGGuidance scale (w)=7.52025.10 | 14.29 | — | — | — | — | — | — | — | — | — | 0.314 | — | — | — | — | — | — | — | — | — | |
| SDXL-DMD2†Steps=1, #Params=2.6B2025.09 | 14.49 | — | — | — | — | — | — | — | — | — | 0.343 | — | — | — | — | — | — | — | — | — | |
| SEED-XType=LLM (Cont.), Decoder=SDXL, Zero-shot=true2024.06 | 14.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TRONTraining Protocol=Zero-shot (pre-trained models only), Backbone=BigGAN, CLIP version=Standard CLIP, Caption model=BLIP2023.04 | 15 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DSE-GANModel Type=GAN2023.05 | 15.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IPAdapter2026.05 | 15.82 | — | — | — | — | — | — | — | — | — | 0.27 | — | — | — | 5.66 | — | — | — | — | — | |
| Guidance CorrectionGuidance scale (w)=12.52025.10 | 16.04 | — | — | — | — | — | — | — | — | — | 0.315 | — | — | — | — | — | — | — | — | — | |
| FuseDreamTraining Protocol=Zero-shot (pre-trained models only), Inference Algorithm=Langevin dynamics2023.04 | 16.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UIO-2model_size=L2023.12 | 16.68 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OursDistillation=LCM, Steps=42025.10 | 16.98 | — | — | — | — | — | — | — | — | — | 0.306 | — | — | — | — | — | — | — | — | — | |
| CFGGuidance scale (w)=12.52025.10 | 17.28 | — | — | — | — | — | — | — | — | — | 0.315 | — | — | — | — | — | — | — | — | — | |
| CFG++Guidance scale (w)=12.52025.10 | 17.76 | — | — | — | — | — | — | — | — | — | 0.315 | — | — | — | — | — | — | — | — | — | |
| SDXL-LCM†Steps=4, #Params=2.6B2025.09 | 17.83 | — | — | — | — | — | — | — | — | — | 0.327 | — | — | — | — | — | — | — | — | — | |
| CFGDistillation=LCM, Steps=42025.10 | 17.91 | — | — | — | — | — | — | — | — | — | 0.306 | — | — | — | — | — | — | — | — | — | |
| SuPLoRAIs Mass=true, Storage/MB(↓)=154, Time/m(↓)=182026.01 | 17.92 | — | — | — | — | — | — | — | — | — | 30.68 | — | — | — | — | — | — | — | — | — | |
| CE-SDWVIs Mass=true, Storage/MB(↓)=265, Time/m(↓)=292026.01 | 18.11 | — | — | — | — | — | — | — | — | — | 30.1 | — | — | — | — | — | — | — | — | — | |
| MACEIs Mass=true, Storage/MB(↓)=198, Time/m(↓)=202026.01 | 18.36 | — | — | — | — | — | — | — | — | — | 30.04 | — | — | — | — | — | — | — | — | — | |
| UCEIs Mass=true, Storage/MB(↓)=3379, Time/m(↓)=2182026.01 | 18.51 | — | — | — | — | — | — | — | — | — | 29.8 | — | — | — | — | — | — | — | — | — | |
| SRS-MEIs Mass=true, Storage/MB(↓)=302, Time/m(↓)=262026.01 | 18.51 | — | — | — | — | — | — | — | — | — | 30.03 | — | — | — | — | — | — | — | — | — | |
| SSA-GANModel Type=GAN2023.05 | 19.37 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |