Text-to-Image Generation on GenEval (test)
99Two Obj. AccCosmos-Predict2
Evaluation Results
| Method | Links | |||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Cosmos-Predict2#Params=2B, Resolution=1360 x 768, NFE=35x22025.10 | 99 | 100 | 73 | 89 | 65 | 73 | 83 | — | — | — | — | — | — | — | — | — | — | |
| Cosmos-Predict2 + rCM#Params=0.6B, Resolution=1360 x 768, NFE=42025.10 | 99 | 100 | 74 | 88 | 48 | 66 | 79 | — | — | — | — | — | — | — | — | — | — | |
| Cosmos-Predict2 + rCM#Params=2B, Resolution=1360 x 768, NFE=22025.10 | 99 | 100 | 76 | 85 | 59 | 74 | 82 | — | — | — | — | — | — | — | — | — | — | |
| Cosmos-Predict2 + rCM#Params=14B, Resolution=1360 x 768, NFE=22025.10 | 99 | 100 | 80 | 87 | 47 | 73 | 81 | — | — | — | — | — | — | — | — | — | — | |
| HiDream-I1Config=Full2025.12 | 98 | 100 | 79 | 91 | 60 | 72 | 83 | — | — | — | — | — | — | — | — | — | — | |
| HiDream-I1-FullModel Category=Diffusion Models2026.02 | 98 | 100 | 79 | 91 | 60 | 72 | 83 | — | — | — | — | — | — | — | — | — | — | |
| Cosmos-Predict2#Params=14B, Resolution=1360 x 768, NFE=35x22025.10 | 98 | 100 | 79 | 90 | 64 | 72 | 84 | — | — | — | — | — | — | — | — | — | — | |
| Cosmos-Predict2 + DMD2#Params=0.6B, Resolution=1360 x 768, NFE=42025.10 | 98 | 100 | 76 | 85 | 46 | 66 | 77 | — | — | — | — | — | — | — | — | — | — | |
| Cosmos-Predict2 + DMD2#Params=2B, Resolution=1360 x 768, NFE=42025.10 | 98 | 99 | 70 | 87 | 57 | 72 | 80 | — | — | — | — | — | — | — | — | — | — | |
| Cosmos-Predict2 + rCM#Params=2B, Resolution=1360 x 768, NFE=42025.10 | 98 | 100 | 73 | 84 | 58 | 72 | 81 | — | — | — | — | — | — | — | — | — | — | |
| Cosmos-Predict2 + rCM#Params=14B, Resolution=1360 x 768, NFE=42025.10 | 98 | 100 | 80 | 86 | 59 | 73 | 83 | — | — | — | — | — | — | — | — | — | — | |
| Cosmos-Predict2 + rCM#Params=0.6B, Resolution=1360 x 768, NFE=22025.10 | 98 | 99 | 74 | 86 | 48 | 66 | 78 | — | — | — | — | — | — | — | — | — | — | |
| Cosmos-Predict2 + rCM#Params=0.6B, Resolution=1360 x 768, NFE=12025.10 | 98 | 100 | 72 | 86 | 49 | 66 | 78 | — | — | — | — | — | — | — | — | — | — | |
| Cosmos-Predict2 + rCM#Params=14B, Resolution=1360 x 768, NFE=12025.10 | 98 | 100 | 84 | 89 | 49 | 72 | 82 | — | — | — | — | — | — | — | — | — | — | |
| HiDream-I1-Full2026.04 | 98 | 100 | 79 | 91 | 60 | 72 | 83 | — | — | — | — | — | — | — | — | — | — | |
| FMTT (Ours)NFE=14002025.11 | 97 | 100 | 90 | 91 | 30 | 64 | — | 79 | — | — | — | — | — | — | — | — | — | |
| Cosmos-Predict2#Params=0.6B, Resolution=1360 x 768, NFE=35x22025.10 | 97 | 100 | 74 | 86 | 59 | 70 | 81 | — | — | — | — | — | — | — | — | — | — | |
| Cosmos-Predict2 + rCM#Params=2B, Resolution=1360 x 768, NFE=12025.10 | 97 | 99 | 77 | 85 | 57 | 71 | 81 | — | — | — | — | — | — | — | — | — | — | |
| MogaoModel Category=Integrating Autoregressive and Diffusion within Transformers, Evaluation Protocol=VLMEvalKit2026.03 | 97 | 100 | 83 | 93 | 84 | 80 | 89 | — | — | — | — | — | — | — | — | — | — | |
| SeedreamVersion=3.02025.12 | 96 | 99 | 91 | 93 | 47 | 80 | 84 | — | — | — | — | — | — | — | — | — | — | |
| Seedream 3.0Model Category=Proprietary Models2026.02 | 96 | 99 | 91 | 93 | 47 | 80 | 84 | — | — | — | — | — | — | — | — | — | — | |
| BitDanceModel Category=Autoregressive Models2026.02 | 96 | 100 | 71 | 95 | 72 | 83 | 86 | — | — | — | — | — | — | — | — | — | — | |
| coDrawAgents2026.03 | 96 | 100 | 94 | 97 | 95 | 81 | 94 | — | — | — | — | — | — | — | — | — | — | |
| Seedream 3.02026.04 | 96 | 99 | 91 | 93 | 47 | 80 | 84 | — | — | — | — | — | — | — | — | — | — | |
| Flow Map + Multi-best-of-NNFE=12802025.11 | 95 | 100 | 84 | 85 | 26 | 69 | — | 76 | — | — | — | — | — | — | — | — | — | |
| OmniGen2Diffusion Params=4B2026.02 | 95 | 100 | 64 | 88 | 55 | 76 | 80 | — | — | — | — | — | — | — | — | — | — | |
| Playgroundv3Type=Image Models2026.01 | 95 | 99 | 72 | 82 | 50 | 54 | 76 | — | — | — | — | — | — | — | — | — | — | |
| SANA-Sprint 0.6B + Weighted Diamond MapsTime (s)=102026.02 | 95 | 100 | 84 | 94 | 61 | 65 | — | 83 | — | — | — | — | — | — | — | — | — | |
| Z-Image-TurboModel Category=Diffusion Models2026.02 | 95 | 100 | 77 | 89 | 65 | 68 | 82 | — | — | — | — | — | — | — | — | — | — | |
| BAGELModel Category=Diffusion Models2026.02 | 95 | 98 | 84 | 95 | 78 | 77 | 88 | — | — | — | — | — | — | — | — | — | — | |
| OmniGen2Model Category=Multi-modal Understanding Models as Enhanced Conditional Encoders2026.03 | 95 | 100 | 64 | 88 | 55 | 76 | 80 | — | — | — | — | — | — | — | — | — | — | |
| BAGEL2026.04 | 95 | 98 | 84 | 95 | 78 | 77 | 88 | — | — | — | — | — | — | — | — | — | — | |
| APEXModel Size=20B, Adaptation=LoRA, LoRA Rank (r)=32, NFE=12026.04 | 95 | 99 | 85 | 90 | 79 | 78 | 88 | — | — | — | — | — | — | — | — | — | — | |
| Uni-CoTModel Category=Unified Model2026.05 | 95 | 99 | 82 | 89 | 60 | 72 | 83 | — | — | — | — | — | — | — | — | — | — | |
| VACoTModel Category=Unified Model2026.05 | 95 | 99 | 80 | 90 | 66 | 71 | 84 | — | — | — | — | — | — | — | — | — | — | |
| Pro-GRPOFine-tuning Reward=PickScore2025.12 | 94.7 | — | — | 86.7 | 32.3 | — | 72.6 | — | — | — | — | — | — | — | — | — | — | |
| Flow-GRPOFine-tuning Reward=PickScore2025.12 | 94.2 | — | — | 85.1 | 28.8 | — | 71.9 | — | — | — | — | — | — | — | — | — | — | |
| SD3-MediumType=Gen. Only, External pretrained diffusion model=false2025.01 | 94 | 99 | 72 | 89 | 33 | 60 | 74 | — | — | — | — | — | — | — | — | — | — | |
| SD2 Modif.Type=Gen. Only, External pretrained diffusion model=true2025.01 | 94 | 99 | 72 | 89 | 33 | 60 | 71 | — | — | — | — | — | — | — | — | — | — | |
| FLUX.1 [dev] + Best-of-NNFE=14402025.11 | 94 | 99 | 83 | 86 | 26 | 57 | — | 75 | — | — | — | — | — | — | — | — | — | |
| SD3Type=Image Models2026.01 | 94 | 99 | 72 | 89 | 33 | 60 | 74 | — | — | — | — | — | — | — | — | — | — | |
| VisionDirector2025.12 | 94 | 99 | 96 | 92 | 88 | 95 | 94 | — | — | — | — | — | — | — | — | — | — | |
| Z-ImageModel Category=Diffusion Models2026.02 | 94 | 100 | 78 | 93 | 62 | 77 | 84 | — | — | — | — | — | — | — | — | — | — | |
| BAGELModel Category=Integrating Autoregressive and Diffusion within Transformers2026.03 | 94 | 99 | 81 | 88 | 64 | 63 | 82 | — | — | — | — | — | — | — | — | — | — | |
| SD3-Mediumsize=Medium2026.03 | 94 | 99 | 72 | 89 | 33 | 60 | 74 | — | — | — | — | — | — | — | — | — | — | |
| APEXModel Size=20B, Adaptation=LoRA, LoRA Rank (r)=64, NFE=12026.04 | 94 | 99 | 88 | 90 | 85 | 78 | 89 | — | — | — | — | — | — | — | — | — | — | |
| SD3-MediumModel Category=Gen-only2026.05 | 94 | 99 | 72 | 89 | 33 | 60 | 74 | — | — | — | — | — | — | — | — | — | — | |
| Self-adaptive Interleaved Visual Reasoner (Ours)Model Category=Unified Model2026.05 | 94 | 98 | 90 | 93 | 79 | 81 | 89 | — | — | — | — | — | — | — | — | — | — | |
| FMTT - 4-step diffusion look-aheadNFE=1400, look-ahead strategy=4-step diffusion2025.11 | 93 | 99 | 86 | 89 | 27 | 57 | — | 75 | — | — | — | — | — | — | — | — | — | |
| SANA-Sprint 0.6B + ReNOTime (s)=302026.02 | 93 | 99 | 74 | 92 | 60 | 67 | — | 81 | — | — | — | — | — | — | — | — | — | |
| SANA-1.5#Params=4.8B, Resolution=1024 x 1024, NFE=20x22025.10 | 93 | 99 | 86 | 84 | 59 | 65 | 81 | — | — | — | — | — | — | — | — | — | — | |
| UniWorld-V1Model Category=Multi-modal Understanding Models as Enhanced Conditional Encoders2026.03 | 93 | 99 | 79 | 89 | 49 | 70 | 80 | — | — | — | — | — | — | — | — | — | — | |
| UniWorld-V1version=V12026.03 | 93 | 99 | 79 | 89 | 49 | 70 | 80 | — | — | — | — | — | — | — | — | — | — | |
| FLUX.1-devModel Category=Gen-only2026.05 | 93 | 98 | 75 | 93 | 68 | 65 | 82 | — | — | — | — | — | — | — | — | — | — | |
| Flow Map + Beam SearchNFE=12002025.11 | 92 | 100 | 86 | 85 | 29 | 58 | — | 75 | — | — | — | — | — | — | — | — | — | |
| GPT Image 1Setting=High2025.12 | 92 | 99 | 85 | 92 | 75 | 61 | 84 | — | — | — | — | — | — | — | — | — | — | |
| Qwen-Image2025.12 | 92 | 99 | 89 | 88 | 76 | 77 | 87 | — | — | — | — | — | — | — | — | — | — | |
| Qwen-ImageTime (s)=352026.02 | 92 | 99 | 89 | 88 | 76 | 77 | — | 87 | — | — | — | — | — | — | — | — | — | |
| SANA-Sprint 0.6B + Best-of-NTime (s)=152026.02 | 92 | 99 | 72 | 91 | 53 | 65 | — | 79 | — | — | — | — | — | — | — | — | — | |
| GPT Image 1Model Category=Proprietary Models2026.02 | 92 | 99 | 85 | 92 | 75 | 61 | 84 | — | — | — | — | — | — | — | — | — | — | |
| Qwen-ImageModel Category=Diffusion Models2026.02 | 92 | 99 | 89 | 88 | 76 | 77 | 87 | — | — | — | — | — | — | — | — | — | — | |
| TarModel Category=Autoregressive Models2026.02 | 92 | 98 | 83 | 85 | 80 | 65 | 84 | — | — | — | — | — | — | — | — | — | — | |
| SANA-Sprint#Params=1.6B, Resolution=1024 x 1024, NFE=42025.10 | 92 | 100 | 59 | 91 | 54 | 55 | 75 | — | — | — | — | — | — | — | — | — | — | |
| Janus-4oModel Category=Unifying Understanding and Generation via Next-token Prediction2026.03 | 92 | 100 | 58 | 88 | 70 | 70 | 80 | — | — | — | — | — | — | — | — | — | — | |
| GPT Image 1 [High]mode=High2026.03 | 92 | 99 | 85 | 92 | 75 | 61 | 84 | — | — | — | — | — | — | — | — | — | — | |
| GPT Image 1 [High]2026.04 | 92 | 99 | 85 | 92 | 75 | 61 | 84 | — | — | — | — | — | — | — | — | — | — | |
| Qwen-Image2026.04 | 92 | 99 | 89 | 88 | 76 | 77 | 87 | — | — | — | — | — | — | — | — | — | — | |
| APEXModel Size=20B, Adaptation=SFT, NFE=12026.04 | 92 | 99 | 83 | 91 | 86 | 81 | 89 | — | — | — | — | — | — | — | — | — | — | |
| BAGELModel Category=Unified Model2026.05 | 92 | 99 | 78 | 87 | 53 | 64 | 79 | — | — | — | — | — | — | — | — | — | — | |
| UiGModel Category=Unified Model2026.05 | 92 | 99 | 81 | 89 | 61 | 69 | 82 | — | — | — | — | — | — | — | — | — | — | |
| SANA-Sprint 0.6B + Prompt OptimizationTime (s)=952026.02 | 91 | 99 | 82 | 89 | 36 | 56 | — | 75 | — | — | — | — | — | — | — | — | — | |
| TwinFlowNFE=12026.04 | 91 | 100 | 84 | 90 | 75 | 74 | 86 | — | — | — | — | — | — | — | — | — | — | |
| APEXModel Size=0.6B, NFE=12026.04 | 91 | 99 | 75 | 93 | 76 | 69 | 84 | — | — | — | — | — | — | — | — | — | — | |
| APEXModel Size=1.6B, NFE=12026.04 | 91 | 99 | 75 | 93 | 76 | 68 | 84 | — | — | — | — | — | — | — | — | — | — | |
| FMTT - 1-step denoiser look-aheadNFE=350, look-ahead strategy=1-step denoiser2025.11 | 90 | 99 | 87 | 87 | 26 | 59 | — | 75 | — | — | — | — | — | — | — | — | — | |
| SD3-MediumTime (s)=4.42026.02 | 90 | 100 | 72 | 87 | 31 | 66 | — | 70 | — | — | — | — | — | — | — | — | — | |
| SANA-Sprint#Params=0.6B, Resolution=1024 x 1024, NFE=42025.10 | 90 | 100 | 71 | 89 | 61 | 54 | 77 | — | — | — | — | — | — | — | — | — | — | |
| Janus-Pro-7BType=Und. and Gen., External pretrained diffusion model=false2025.01 | 89 | 99 | 59 | 90 | 79 | 66 | 80 | — | — | — | — | — | — | — | — | — | — | |
| Flow Map + ReNONFE=12802025.11 | 89 | 98 | 79 | 89 | 20 | 57 | — | 71 | — | — | — | — | — | — | — | — | — | |
| SD3.5Size=Large2025.12 | 89 | 98 | 73 | 83 | 34 | 47 | 71 | — | — | — | — | — | — | — | — | — | — | |
| Janus-ProParameters=7B2025.12 | 89 | 99 | 59 | 90 | 79 | 66 | 80 | — | — | — | — | — | — | — | — | — | — | |
| SD3.5-LargeModel Category=Diffusion Models2026.02 | 89 | 98 | 73 | 83 | 34 | 47 | 71 | — | — | — | — | — | — | — | — | — | — | |
| Janus-ProModel Category=Autoregressive Models2026.02 | 89 | 99 | 59 | 90 | 79 | 66 | 80 | — | — | — | — | — | — | — | — | — | — | |
| SD3.5-L#Params=8B, Resolution=1024 x 1024, NFE=28x22025.10 | 89 | 98 | 73 | 83 | 34 | 47 | 71 | — | — | — | — | — | — | — | — | — | — | |
| SD3.5-L-Turbo#Params=8B, Resolution=1024 x 1024, NFE=42025.10 | 89 | 99 | 68 | 78 | 23 | 54 | 68 | — | — | — | — | — | — | — | — | — | — | |
| SD3.5 Large2026.04 | 89 | 98 | 73 | 83 | 34 | 47 | 71 | — | — | — | — | — | — | — | — | — | — | |
| Janus-Pro-7B2026.04 | 89 | 99 | 59 | 90 | 79 | 66 | 80 | — | — | — | — | — | — | — | — | — | — | |
| Qwen-Image-Lightning2026.04 | 89 | 99 | 85 | 87 | 75 | 76 | 85 | — | — | — | — | — | — | — | — | — | — | |
| Janus-Pro-7BModel Category=Unified Model2026.05 | 89 | 99 | 59 | 90 | 79 | 66 | 80 | — | — | — | — | — | — | — | — | — | — | |
| Flow Map + Best-of-NNFE=1282025.11 | 88 | 100 | 82 | 85 | 25 | 59 | — | 73 | — | — | — | — | — | — | — | — | — | |
| PixelGen-XXL/16Diffusion Params=1.1B2026.02 | 88 | 99 | 59 | 90 | 70 | 70 | 79 | — | — | — | — | — | — | — | — | — | — | |
| HunyuanVideoType=Video Models, LLM rewriter=true2026.01 | 88 | 96 | 43 | 84 | 66 | 47 | 71 | — | — | — | — | — | — | — | — | — | — | |
| VINOType=Video Models, LLM rewriter=true2026.01 | 88 | 97 | 52 | 88 | 65 | 62 | 75 | — | — | — | — | — | — | — | — | — | — | |
| FLUX.1-schnell#Params=12B, Resolution=1024 x 1024, NFE=42025.10 | 88 | 99 | 64 | 78 | 30 | 52 | 69 | — | — | — | — | — | — | — | — | — | — | |
| DALL-E 3Type=Gen. Only, External pretrained diffusion model=false2025.01 | 87 | 96 | 47 | 83 | 43 | 45 | 67 | — | — | — | — | — | — | — | — | — | — | |
| DALL-E 3Type=Gen. Only2024.11 | 87 | 96 | 47 | 83 | 43 | 45 | 67 | — | — | — | — | — | — | — | — | — | — | |
| DALL-E 32026.02 | 87 | 96 | 47 | 83 | 43 | 45 | 67 | — | — | — | — | — | — | — | — | — | — | |
| DALLE 3Type=Image Models2026.01 | 87 | 96 | 47 | 83 | 43 | 45 | 67 | — | — | — | — | — | — | — | — | — | — | |
| Lumina-ImageVersion=2.02025.12 | 87 | 100 | 67 | 93 | 34 | 62 | 73 | — | — | — | — | — | — | — | — | — | — | |
| Lumina-Image-2.0Model Category=Diffusion Models2026.02 | 87 | — | 67 | — | — | 62 | 73 | — | — | — | — | — | — | — | — | — | — |