Text-to-Image Generation on VFN
74.9PrecisionReal images (Ref Value)
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Real images (Ref Value)type=Reference2026.01 | 74.9 | 77.9 | 76.3 | 97.9 | — | |
| SD3 + PGPrompt Grafting=true, Backbone=SD32026.01 | 55.8 | 51.8 | 53.7 | 99.6 | 49 | |
| SD3 + SCSpatial Cues=true, Backbone=SD32026.01 | 54 | 48 | 50.8 | 99.2 | 47.8 | |
| SD3Backbone=Stable Diffusion v32026.01 | 53.3 | 45.4 | 49 | 99.4 | 40.5 | |
| FLUX.12026.01 | 52 | 44.2 | 47.8 | 99.4 | 40.5 | |
| SD3 + PG w/o SCPrompt Grafting=true, Spatial Cues=false, Backbone=SD32026.01 | 51.3 | 48.7 | 50 | 99.5 | 43.7 | |
| AAEBackbone=Attend & Excite2026.01 | 50.9 | 38.7 | 43.9 | 95.7 | 39.6 | |
| Syngen2026.01 | 48.4 | 31.2 | 37.9 | 95.8 | 40.6 | |
| STDBackbone=Structured Diffusion2026.01 | 46.9 | 33.6 | 39.2 | 90.5 | 45.2 | |
| FoCULRText encoder fine-tuning=true2025.12 | 45.7 | 43.3 | 44.5 | — | 73.7 | |
| TextCraftorText encoder fine-tuning=true2025.12 | 37.5 | 32.9 | 35 | — | 72.7 | |
| Stable Diffusion 3 (SD3)Text encoder fine-tuning=false2025.12 | 34.4 | 31.1 | 32.7 | — | 83.9 | |
| Structured diffusionText encoder fine-tuning=false2025.12 | 29.6 | 24.3 | 26.7 | — | 84.8 | |
| SDBackbone=Stable Diffusion2026.01 | 25.2 | 16.5 | 19.9 | 82.1 | 40.5 | |
| Stable diffusionText encoder fine-tuning=false2025.12 | 24.8 | 19.5 | 21.8 | — | 86.2 | |
| SyngenText encoder fine-tuning=false2025.12 | 19.6 | 12.4 | 15.2 | — | 92 |