Text-to-Image Generation on FLUX
10.42Training Memory (GiB)DiT-BlockSkip
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| DiT-BlockSkipSkip Ratio=50 %, Training Resolution=256×256, Inference resolution=1024 × 10242026.03 | 10.42 | 7.63 | 0.25 | 2.55 | 9.96 | 9.94 | |
| HollowedNetSkip Ratio=50 %, Training Resolution=512×512, Inference resolution=1024 × 10242026.03 | 12.23 | 7.93 | 0.54 | 3.76 | 11.8 | 19.85 | |
| DiT-BlockSkipSkip Ratio=40 %, Training Resolution=256×256, Inference resolution=1024 × 10242026.03 | 15.61 | 11.58 | 0.56 | 3.46 | 12.3 | 9.94 | |
| HollowedNetSkip Ratio=40 %, Training Resolution=512×512, Inference resolution=1024 × 10242026.03 | 18.4 | 11.91 | 0.79 | 5.7 | 18.44 | 19.85 | |
| DiT-BlockSkipSkip Ratio=30 %, Training Resolution=256×256, Inference resolution=1024 × 10242026.03 | 20.78 | 15.54 | 0.88 | 4.37 | 14.59 | 9.94 | |
| HollowedNetSkip Ratio=30 %, Training Resolution=512×512, Inference resolution=1024 × 10242026.03 | 24.11 | 15.62 | 1.04 | 7.46 | 24.35 | 19.85 | |
| LoRA-FATraining Resolution=512×512, Inference resolution=1024 × 10242026.03 | 32.48 | 22.84 | 0.67 | 8.97 | 41.32 | — | |
| LISATraining Resolution=512×512, Inference resolution=1024 × 10242026.03 | 35.98 | 22.84 | 1.34 | 9.33 | 41.67 | — | |
| LoRATraining Resolution=512×512, Inference resolution=1024 × 10242026.03 | 35.99 | 22.84 | 1.34 | 11.82 | 41.67 | — | |
| Textual InversionTraining Resolution=512×512, Inference resolution=1024 × 10242026.03 | 42.15 | 31.27 | 0.14 | 10.74 | 44.57 | — | |
| DreamBoothTraining Resolution=512×512, Inference resolution=1024 × 10242026.03 | 68.96 | 22.17 | 22.52 | 24.27 | 158.77 | — |