Controllable Text-to-Image Generation on MultiGen-20M
11.85FIDPixelPonder
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| PixelPonderConditions=all, Inference Time=9.592025.03 | 11.85 | 78.6 | 43.99 | 69.54 | |
| CocktailConditions=pose+hed, Inference Time=4.942025.03 | 24.67 | 79.87 | 24.14 | 67.13 | |
| UniControlConditions=all, Inference Time=7.392025.03 | 25.15 | 74.09 | 35.58 | 72.05 | |
| Uni-ControlNetConditions=all, Inference Time=7.222025.03 | 32.58 | 78.08 | 29.37 | 65.85 | |
| T2I-AdapterConditions=all, Inference Time=9.332025.03 | 66.95 | 71.47 | 24.03 | 57.95 |