Text-to-Image Generation on HPD
64PickScoreBalancedDPO vs DiffusionDPO
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| BalancedDPO vs DiffusionDPOcomparison=BalancedDPO vs DiffusionDPO2025.03 | 64 | 60 | — | 69.33 | — | — | 57.33 | |
| BalancedDPO vs SD1.5comparison=BalancedDPO vs SD1.52025.03 | 60.67 | 63.33 | — | 72.67 | — | — | 72.67 | |
| DiffusionDPO vs SD1.5comparison=DiffusionDPO vs SD1.52025.03 | 47.33 | 56 | — | 50.67 | — | — | 74 | |
| ReFL + RSA-FTBackbone=SDXL, Resolution=1024 × 10242026.03 | 23.08 | — | 1.111 | — | — | — | 32.66 | |
| Diff.-LAIRBase Model=SDXL, Samples per prompt=52026.05 | 23.033 | 6.152 | 1.13 | 39.1 | — | — | 0.295 | |
| Diffusion LAIRBase Model=SDXL, Samples per prompt=52026.05 | 23.033 | 6.152 | 1.13 | 39.1 | — | — | 0.295 | |
| InPOBase Model=SDXL, Samples per prompt=52026.05 | 23.001 | 6.186 | 1.074 | 38.4 | — | — | 0.2939 | |
| InPOBase Model=SDXL, Samples per prompt=52026.05 | 23.001 | 6.186 | 1.074 | 38.4 | — | — | 0.2939 | |
| Diff.-DPOBase Model=SDXL, Samples per prompt=52026.05 | 22.949 | 6.141 | 1.082 | 38.8 | — | — | 0.2921 | |
| Diff.-DPOBase Model=SDXL, Samples per prompt=52026.05 | 22.949 | 6.141 | 1.082 | 38.8 | — | — | 0.2921 | |
| DRTune + RSA-FTBackbone=SDXL, Resolution=1024 × 10242026.03 | 22.94 | — | 1.208 | — | — | — | 33.74 | |
| DRTuneBackbone=SDXL, Resolution=1024 × 10242026.03 | 22.78 | — | 1.095 | — | — | — | 32.36 | |
| ReFLBackbone=SDXL, Resolution=1024 × 10242026.03 | 22.66 | — | 1.039 | — | — | — | 31.21 | |
| MaPOBase Model=SDXL, Samples per prompt=52026.05 | 22.638 | 6.245 | 0.968 | 38.2 | — | — | 0.2902 | |
| MaPOBase Model=SDXL, Samples per prompt=52026.05 | 22.638 | 6.245 | 0.968 | 38.2 | — | — | 0.2902 | |
| SDXLBase Model=SDXL, Samples per prompt=52026.05 | 22.589 | 6.134 | 0.865 | 38.2 | — | — | 0.286 | |
| SDXLBase Model=SDXL, Samples per prompt=52026.05 | 22.589 | 6.134 | 0.865 | 38.2 | — | — | 0.286 | |
| VanillaBackbone=SDXL, Resolution=1024 × 10242026.03 | 22.56 | — | 0.921 | — | — | — | 28.92 | |
| ReFL + RSA-FTBackbone=SD3, Resolution=1024 x 10242026.03 | 22.41 | — | 1.168 | — | — | — | 31.43 | |
| DRTune + RSA-FTBackbone=SD3, Resolution=1024 x 10242026.03 | 22.41 | — | 1.212 | — | — | — | 31.86 | |
| VanillaBackbone=SD3, Resolution=1024 x 10242026.03 | 22.4 | — | 1.123 | — | — | — | 30.48 | |
| ReFLBackbone=SD3, Resolution=1024 x 10242026.03 | 22.37 | — | 1.151 | — | — | — | 31.22 | |
| DRTuneBackbone=SD3, Resolution=1024 x 10242026.03 | 22.33 | — | 1.162 | — | — | — | 31.31 | |
| Diffusion LAIRBase Model=SD1.5, Samples per prompt=52026.05 | 22.068 | 5.904 | 0.8382 | 36.7 | — | — | 0.2871 | |
| InPOBase Model=SD1.5, Samples per prompt=52026.05 | 21.792 | 5.873 | 0.8114 | 36.59 | — | — | 0.2862 | |
| Diff.-KTOBase Model=SD1.5, Samples per prompt=52026.05 | 21.43 | 5.792 | 0.6835 | 35.72 | — | — | 0.2849 | |
| DSPOBase Model=SD1.5, Samples per prompt=52026.05 | 21.426 | 5.873 | 0.6612 | 35.66 | — | — | 0.2833 | |
| Diff.-DPOBase Model=SD1.5, Samples per prompt=52026.05 | 21.226 | 5.688 | 0.3087 | 35.53 | — | — | 0.2767 | |
| SD1.5Base Model=SD1.5, Samples per prompt=52026.05 | 20.792 | 5.567 | 0.0988 | 34.98 | — | — | 0.2723 | |
| Semantic Erasure and Horizontal InjectionModel=SDXL2025.11 | 16.8347 | 5.6173 | -1.9221 | 15.3116 | — | — | — | |
| Semantic Erasure and Horizontal InjectionModel=FLUX.1-Dev2025.11 | 16.8015 | 5.9517 | -1.8881 | 16.6501 | — | — | — | |
| NPNetModel=SDXL2025.11 | 16.78 | 5.6 | -1.948 | 15.04 | — | — | — | |
| InitnoModel=SDXL2025.11 | 16.765 | 5.59 | -1.952 | 15.01 | — | — | — | |
| NPNetModel=FLUX.1-Dev2025.11 | 16.75 | 5.895 | -1.944 | 15.9 | — | — | — | |
| StandardModel=SDXL2025.11 | 16.7476 | 5.5804 | -1.9545 | 14.9859 | — | — | — | |
| StandardModel=FLUX.1-Dev2025.11 | 16.73 | 5.8808 | -1.9506 | 15.0207 | — | — | — | |
| Probe-Select2026.03 | 0.23 | — | 1.38 | 36 | 0.51 | 0.98 | — | |
| Baseline2026.03 | 0.22 | — | 1.12 | 34 | 0.48 | 0.95 | — |