Text-to-Image Generation on Qwen-Image (FID & HPSv2.1)
28.13FIDQwen-Image + ours
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Qwen-Image + oursBase Model=Qwen-Image, Supervision=vision-aligned text feature supervision2026.05 | 28.13 | 83.04 | 30.44 | 24.88 | |
| Qwen-Image + SFTBase Model=Qwen-Image, Supervision=SFT2026.05 | 28.16 | 82.53 | 30.37 | 21.51 | |
| Qwen-Image (Baseline)Base Model=Qwen-Image2026.05 | 33.3 | 79.77 | 29.64 | 11.05 |