Text-to-Image Generation on Multi-subject prompts (test)
0.3489CLIP I-TDivide&Bind
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Divide&BindBackbone=SD 3.5, λ=optimal2025.10 | 0.3489 | 0.2316 | 0.5742 | 0.6399 | 22.6779 | 1.3493 | 3.9373 | |
| Attend&ExciteBackbone=SD 3.5, λ=optimal2025.10 | 0.3484 | 0.2326 | 0.5752 | 0.6404 | 22.695 | 1.3545 | 3.1714 | |
| FOCUSBackbone=SD 3.5, λ=optimal2025.10 | 0.3483 | 0.2344 | 0.5751 | 0.6385 | 22.7499 | 1.4003 | 4.2865 | |
| CONFORMBackbone=SD 3.5, λ=optimal2025.10 | 0.3481 | 0.2323 | 0.5773 | 0.6421 | 22.7188 | 1.3684 | 3.4336 | |
| BaseBackbone=SD 3.5, λ=optimal2025.10 | 0.3474 | 0.2309 | 0.5731 | 0.6402 | 22.694 | 1.3175 | 0 | |
| Divide&BindBackbone=FLUX.1, λ=optimal2025.10 | 0.3453 | 0.2272 | 0.5722 | 0.633 | 23.4395 | 1.2939 | 1.6352 | |
| BaseBackbone=FLUX.1, λ=optimal2025.10 | 0.3449 | 0.2271 | 0.5739 | 0.63 | 23.4234 | 1.297 | 0 | |
| FOCUSBackbone=FLUX.1, λ=optimal2025.10 | 0.3446 | 0.2268 | 0.5741 | 0.6326 | 23.4274 | 1.2913 | 1.9712 | |
| CONFORMBackbone=FLUX.1, λ=optimal2025.10 | 0.3436 | 0.2252 | 0.5726 | 0.6321 | 23.3574 | 1.2461 | 1.5114 | |
| Attend&ExciteBackbone=FLUX.1, λ=optimal2025.10 | 0.343 | 0.2242 | 0.5716 | 0.6304 | 23.2549 | 1.2494 | 1.7595 |