Human Preference Alignment on SD3.5 Medium
0.361HPS-v2.1TMPO
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| TMPOTime (s)=63.9, Fine-tuning=LoRA2026.05 | 0.361 | 1.358 | 23.551 | 0.118 | 0.239 | |
| Flow-GRPOTime (s)=101.8, Fine-tuning=LoRA2026.05 | 0.355 | 1.329 | 23.289 | -0.123 | 0.195 | |
| TreeGRPOTime (s)=74.6, Fine-tuning=LoRA2026.05 | 0.351 | 1.298 | 22.817 | -0.289 | 0.168 | |
| MixGRPOTime (s)=96.2, Fine-tuning=LoRA2026.05 | 0.348 | 1.351 | 23.019 | -0.238 | 0.175 | |
| GARDOTime (s)=105.1, Fine-tuning=LoRA2026.05 | 0.329 | 1.335 | 23.102 | 0.072 | 0.227 | |
| SD3.5-MediumTraining=Baseline2026.05 | 0.272 | 0.893 | 21.592 | -0.061 | 0.213 |