Text-to-Image Generation on GenEval
97.58GenEval ScoreOurs
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| OursModel=SD3.5-M2026.05 | 97.58 | — | — | — | — | — | — | — | — | |
| GRPOModel=SD3.5-M2026.05 | 96.2 | — | — | — | — | — | — | — | — | |
| SD3.5-M+Flow-GRPOArchitecture=Flow Matching Models, Size=Medium, Algorithm=Flow-GRPO2025.05 | 95 | 100 | 99 | 95 | 92 | 99 | 86 | — | — | |
| FLUX.2 4B w/ RTDMDNFE=42026.05 | 90.46 | — | — | — | — | — | — | — | — | |
| MoS-LInteraction Type=MoS, Model Parameters=5B2025.11 | 90 | — | — | — | — | — | — | — | — | |
| Meta-TTRLModel=QWEM-IMAGE, Train On=TIIF2026.03 | 89.72 | — | — | — | — | — | — | — | — | |
| Qwen-Image + Prompt ReinjectionBase Model=Qwen-Image, Prompt Reinjection=enabled2026.02 | 89.33 | 98.75 | 95.96 | 91.56 | 90.96 | 80.25 | 78.5 | — | — | |
| E-DiT-baseInference Latency (ms)=17022026.02 | 89.3 | — | — | — | — | — | — | — | — | |
| Ovis-U1Size=3B2026.02 | 89 | — | — | — | — | — | — | — | — | |
| MoS-SInteraction Type=MoS, Model Parameters=3B2025.11 | 89 | — | — | — | — | — | — | — | — | |
| Meta-TTRLModel=QWEM-IMAGE, Train On=T2I++2026.03 | 88.52 | — | — | — | — | — | — | — | — | |
| Meta-TTRLModel=QWEM-IMAGE, Train On=DPG2026.03 | 88.43 | — | — | — | — | — | — | — | — | |
| BAGELLLM rewriter=true2025.06 | 88 | — | — | — | — | — | — | — | — | |
| BAGELModel capability category=Unified, LLM rewriter=true2025.06 | 88 | 98 | 95 | 84 | 95 | 78 | 77 | — | — | |
| Lumina-DiMOOParams=8B2026.02 | 88 | — | — | — | — | — | — | — | — | |
| BagelInteraction Type=MoT, Model Parameters=14B2025.11 | 88 | — | — | — | — | — | — | — | — | |
| MUSE-3BType=Unified, # Params=2B+1.6B2026.05 | 88 | — | — | — | — | 89 | — | — | — | |
| Qwen Image + OursModel=Qwen Image, enhancement=token-level2026.01 | 87.77 | 99.06 | 97.22 | 85.94 | 89.89 | 74.75 | 79.75 | 30.6851 | 621.13 | |
| Qwen-ImageBase Model=Qwen-Image, Prompt Reinjection=disabled2026.02 | 87.56 | 98.44 | 94.44 | 90.62 | 89.63 | 75.5 | 76.75 | — | — | |
| Mammoth2Params=8B + 3B + 2B2026.02 | 87 | — | — | — | — | — | — | — | — | |
| LongCat-ImageParams=7B + 6B2026.02 | 87 | — | — | — | — | — | — | — | — | |
| Qwen-ImageParams=7B + 20B2026.02 | 87 | — | — | — | — | — | — | — | — | |
| DeepGen 1.0 (RL)Params=3B + 2B2026.02 | 87 | — | — | — | — | — | — | — | — | |
| Qwen-Image-20BNFE=50 x 22026.02 | 87 | — | — | — | — | — | — | — | — | |
| Base model (Qwen-Image)Inference Latency (ms)=24312026.02 | 87 | — | — | — | — | — | — | — | — | |
| Qwen-ImageInteraction Type=Self-Attn, Model Parameters=20B2025.11 | 87 | — | — | — | — | — | — | — | — | |
| Qwen-Image (Vanilla)Model=QWEM-IMAGE2026.03 | 87 | — | — | — | — | — | — | — | — | |
| UniLIP-3BType=Unified, # Params=2B+1.6B2026.05 | 87 | — | — | — | — | 86 | — | — | — | |
| DeepGen 1.0 (SFT)Params=3B + 2B2026.02 | 86 | — | — | — | — | — | — | — | — | |
| MUSE-1BType=Unified, # Params=1B+0.6B2026.05 | 86 | — | — | — | — | 85 | — | — | — | |
| Qwen-ImageDiffusion Model Type=Latent, Resolution=1024x10242026.05 | 86 | — | — | — | — | — | — | — | — | |
| Qwen ImageModel=Qwen Image2026.01 | 85.51 | 99.06 | 95.2 | 85.62 | 86.17 | 73.75 | 73.25 | 30.451 | 623.27 | |
| E-DiT-turboInference Latency (ms)=12832026.02 | 85.3 | — | — | — | — | — | — | — | — | |
| Qwen-Image-LightningNFE=22026.02 | 85 | — | — | — | — | — | — | — | — | |
| ArcFlow-QwenNFE=22026.02 | 85 | — | — | — | — | — | — | — | — | |
| NExT-OmniSize=7B2026.02 | 85 | — | — | — | — | — | — | — | — | |
| OpenUni-LType=Dual, # Params=2B+1.6B2026.05 | 85 | — | — | — | — | 75 | — | — | — | |
| PPCLInference Latency (ms)=17922026.02 | 84.7 | — | — | — | — | — | — | — | — | |
| UniWorld-V1LLM rewriter=true2025.06 | 84 | — | — | — | — | — | — | — | — | |
| BLIP3-oModel capability category=Unified, LLM rewriter=false2025.06 | 84 | — | — | — | — | — | — | — | — | |
| GPT-4o-ImageModel capability category=Unified, Evaluation source=Tested by [47]2025.06 | 84 | 99 | 92 | 85 | 92 | 75 | 61 | — | — | |
| UniWorld-V1Model capability category=Unified, LLM rewriter=true2025.06 | 84 | 98 | 93 | 81 | 89 | 74 | 71 | — | — | |
| GPT-4oArchitecture=Autoregressive Models2025.05 | 84 | 99 | 92 | 85 | 92 | 75 | 61 | — | — | |
| GPT-Image-12026.02 | 84 | — | — | — | — | — | — | — | — | |
| Seedream 4.02026.02 | 84 | — | — | — | — | — | — | — | — | |
| BLIP3-oParams=7B + 1.4B2026.02 | 84 | — | — | — | — | — | — | — | — | |
| Z-Image-TurboParams=4B + 6B2026.02 | 84 | — | — | — | — | — | — | — | — | |
| BLIP3o#Params=8B2026.02 | 84 | — | — | — | — | — | — | — | — | |
| TarType=Unified, # Params=7B2026.05 | 84 | — | — | — | — | 80 | — | — | — | |
| UniLIP-1BType=Unified, # Params=1B+0.6B2026.05 | 84 | — | — | — | — | 83 | — | — | — | |
| Meta-TTRLModel=BAGEL, Train On=T2I++2026.03 | 83.37 | — | — | — | — | — | — | — | — | |
| X-OmniParams=7B + 12B2026.02 | 83 | — | — | — | — | — | — | — | — | |
| pi-Flow (GM-Qwen)NFE=22026.02 | 83 | — | — | — | — | — | — | — | — | |
| Uni-CoTreasoning=with CoT2025.08 | 83 | 99 | 96 | 84 | 92 | 57 | 71 | — | — | |
| RAEv2Model=DiTDH-XL, Params=0.9B, Protocol=Finetuning2026.05 | 82.7 | — | — | — | — | — | — | — | — | |
| Meta-TTRLModel=BAGEL, Train On=TIIF2026.03 | 82.67 | — | — | — | — | — | — | — | — | |
| Meta-TTRLModel=BAGEL, Train On=DPG2026.03 | 82.67 | — | — | — | — | — | — | — | — | |
| FLUX.1-devModel capability category=Gen. Only, LLM rewriter=true2025.06 | 82 | 98 | 93 | 75 | 93 | 68 | 65 | — | — | |
| BAGELModel capability category=Unified, LLM rewriter=false2025.06 | 82 | 99 | 94 | 81 | 88 | 64 | 63 | — | — | |
| BAGELParams=14B2026.02 | 82 | — | — | — | — | — | — | — | — | |
| FLUX.1 [Dev]Params=12B2026.02 | 82 | — | — | — | — | — | — | — | — | |
| TwinFlow (Qwen)NFE=22026.02 | 82 | — | — | — | — | — | — | — | — | |
| FLUX.1-devType=Gen. Only2025.08 | 82 | 98 | 93 | 75 | 93 | 68 | 65 | — | — | |
| Z-Image + PromptEchoResolution=1024×1024, CFG=4.0, Inference steps=502026.04 | 82 | 100 | 94 | 85 | 86 | 52 | 73 | — | — | |
| FLUX.1-devType=Gen. Only, # Params=12B2026.05 | 82 | — | — | — | — | 68 | — | — | — | |
| BAGELType=Dual, # Params=3B2026.05 | 82 | — | — | — | — | 64 | — | — | — | |
| AsymFLUX.2 kleinDiffusion Model Type=Pixel, Resolution=1024x10242026.05 | 82 | — | — | — | — | — | — | — | — | |
| InsightAR#Params=7B, Resolution=512, #Tokens=1,024, Downsample Rate=16×2026.05 | 82 | — | — | — | — | — | — | — | — | |
| Base ModelModel Architecture=FLUX.2-klein, Fine-tuning Protocol=None2026.05 | 81.55 | — | — | — | — | — | — | — | — | |
| RAEModel=DiTDH-XL, Params=0.9B, Protocol=Finetuning2026.05 | 81.5 | — | — | — | — | — | — | — | — | |
| Meta-TTRLModel=JANUS-PRO-7B, Train On=T2I++2026.03 | 81.14 | — | — | — | — | — | — | — | — | |
| SANA-1.5 4.8BArchitecture=Flow Matching Models, Parameters=4.8B2025.05 | 81 | 99 | 93 | 86 | 84 | 59 | 65 | — | — | |
| BLIP3o#Params=4B2026.02 | 81 | — | — | — | — | — | — | — | — | |
| Uni-CoTreasoning=w/o CoT2025.08 | 81 | 99 | 95 | 82 | 90 | 55 | 69 | — | — | |
| SANA-1.5Interaction Type=Cross-Attn, Model Parameters=4.8B2025.11 | 81 | — | — | — | — | — | — | — | — | |
| LlamaGenTok-AR#Params=7B, Resolution=512, #Tokens=1,024, Downsample Rate=16×2026.05 | 81 | — | — | — | — | — | — | — | — | |
| Janus-Pro2025.06 | 80 | — | — | — | — | — | — | — | — | |
| MetaQuery-XLLLM rewriter=true2025.06 | 80 | — | — | — | — | — | — | — | — | |
| Janus-Pro-7BModel capability category=Unified, LLM rewriter=false2025.06 | 80 | 99 | 89 | 59 | 90 | 79 | 66 | — | — | |
| MetaQuery-XLModel capability category=Unified, LLM rewriter=true2025.06 | 80 | — | — | — | — | — | — | — | — | |
| UniWorld-V1Model capability category=Unified, LLM rewriter=false2025.06 | 80 | 99 | 93 | 79 | 89 | 49 | 70 | — | — | |
| Janus-Pro-7BArchitecture=Autoregressive Models, Parameters=7B2025.05 | 80 | 99 | 89 | 59 | 90 | 79 | 66 | — | — | |
| Janus-Pro-7B# Params=7B2025.03 | 80 | — | 89 | 59 | — | — | 66 | — | — | |
| Janus-ProParams=7B2026.02 | 80 | — | — | — | — | — | — | — | — | |
| MetaQuery-XLParams=7B + 1.6B2026.02 | 80 | — | — | — | — | — | — | — | — | |
| OmniGen2Params=3B + 4B2026.02 | 80 | — | — | — | — | — | — | — | — | |
| UniWorld v1Params=7B + 12B2026.02 | 80 | — | — | — | — | — | — | — | — | |
| CSFM#Params=1.3B, Backbone=UnifiedNextDiT2026.02 | 80 | — | — | — | — | — | — | — | — | |
| OmniGen2Size=3B2026.02 | 80 | — | — | — | — | — | — | — | — | |
| Infinity-8BBackbone=Infinity-8B, #Speed=1.00 ×, #Latency=1.51s, #Param=8.0B2026.02 | 80 | — | 94 | — | — | 58 | 68 | — | — | |
| Janus-Pro-7BModel Size=7B2026.01 | 80 | — | — | — | — | — | — | — | — | |
| Janus-Pro-7BType=Unified2025.08 | 80 | 99 | 89 | 59 | 90 | 79 | 66 | — | — | |
| MetaQuery-XLType=Unified2025.08 | 80 | — | — | — | — | — | — | — | — | |
| OmniGen2Type=Dual, # Params=3B+4B2026.05 | 80 | — | — | — | — | — | — | — | — | |
| Janus-ProType=Unified, # Params=7B2026.05 | 80 | — | — | — | — | 79 | — | — | — | |
| FLUX.2 klein BaseDiffusion Model Type=Latent, Resolution=1024x10242026.05 | 80 | — | — | — | — | — | — | — | — | |
| Lumina-mGPT2.0#Params=7B, Resolution=768, #Tokens=9,216, Downsample Rate=8×2026.05 | 80 | — | — | — | — | — | — | — | — | |
| Janus-Pro#Params=7B, Resolution=384, #Tokens=576, Downsample Rate=16×2026.05 | 80 | — | — | — | — | — | — | — | — | |
| Meta-TTRLModel=JANUS-PRO-7B, Train On=TIIF2026.03 | 79.4 | — | — | — | — | — | — | — | — | |
| BAGEL (Vanilla)Model=BAGEL2026.03 | 79.24 | — | — | — | — | — | — | — | — |