Text-to-Image Generation on Semantic Binding Assessment Subsets
0.7774BLIP-VQA Color AccuracyCoMat
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| CoMatBase Model=SDXL, Train=false2024.11 | 0.7774 | 0.6591 | 0.5262 | — | — | — | — | |
| ToMeBase Model=SDXL, Train=false2024.11 | 0.7656 | 0.6894 | 0.6051 | 1.074 | 0.9281 | 0.5916 | 0.9549 | |
| ELLABase Model=SDXL, Train=true2024.11 | 0.726 | 0.6686 | 0.5634 | — | — | — | — | |
| SynGenBase Model=SDXL, Train=false2024.11 | 0.701 | 0.6044 | 0.5069 | 1.016 | 0.7867 | 0.4016 | 0.6458 | |
| ELLABase Model=SD1.5, Train=true2024.11 | 0.6911 | 0.6308 | 0.4938 | 0.6586 | 0.2963 | 0.0565 | 0.6481 | |
| RanniBase Model=SDXL, Train=true2024.11 | 0.6893 | 0.6325 | 0.4934 | — | — | — | — | |
| SynGenBase Model=SD1.5, Train=false2024.11 | 0.6619 | 0.6451 | 0.4661 | 0.4326 | 0.5072 | 0.0426 | 0.5545 | |
| CoMatBase Model=SD1.5, Train=false2024.11 | 0.6561 | 0.619 | 0.4975 | — | — | — | — | |
| SDXLBase Model=SDXL, Train=-2024.11 | 0.6369 | 0.5637 | 0.5408 | 0.7798 | 0.514 | 0.4029 | 0.4907 | |
| PlayG-v2Base Model=-, Train=-2024.11 | 0.6208 | 0.6125 | 0.5087 | — | — | — | 0.5417 | |
| RanniBase Model=SD1.5, Train=true2024.11 | 0.2414 | 0.3029 | 0.2857 | -0.8554 | -0.6853 | -0.8051 | 0.4166 |