Text-to-Image Generation on User Study v2.1 and v3.5 (test)
53.5Image RealismELDiff
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ELDiffBackbone=SD v2.1, Fine-tuning strategy=ELDiff2026.06 | 53.5 | 57.4 | 48.6 | |
| ELDiffBackbone=SD v3.5, Fine-tuning strategy=ELDiff2026.06 | 42.5 | 42.6 | 38.9 | |
| TokenComposeBackbone=SD v2.1, Fine-tuning strategy=TokenCompose2026.06 | 34.3 | 36.8 | 31.7 | |
| SD v3.5Backbone=SD v3.5, Fine-tuning strategy=None2026.06 | 30.1 | 25 | 29.6 | |
| TokenComposeBackbone=SD v3.5, Fine-tuning strategy=TokenCompose2026.06 | 27.4 | 35.7 | 31.5 | |
| SD v2.1Backbone=SD v2.1, Fine-tuning strategy=None2026.06 | 12.2 | 5.8 | 19.7 |