Text-to-Image Generation on DrawBench (test)
0.427CLIP-ScoreLong-CLIP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Long-CLIPBase Generator=SDXL, Backbone=ViT-L/142026.07 | 0.427 | — | |
| HyFL-CLIPBase Generator=SDXL, Backbone=ViT-L/142026.07 | 0.427 | — | |
| HiMo-CLIPBase Generator=SDXL, Backbone=ViT-L/142026.07 | 0.419 | — | |
| SimM2023.11 | 0.3423 | 53 | |
| Layout-Guidance2023.11 | 0.3354 | 36.5 | |
| Attention-Refocusing2023.11 | 0.3339 | 43.5 | |
| Stable Diffusion2023.11 | 0.3267 | 12.5 | |
| BoxDiff2023.11 | 0.3239 | 30 |