Text-to-Image Generation on PickScore (Out-of-Domain)
0.291CLIP ScoreFlow-GRPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Flow-GRPOBase Model=FLUX.1-dev, Strategy=single-reward RL fine-tuning2026.06 | 0.291 | 21.85 | 0.311 | |
| Flow-DPPOBase Model=FLUX.1-dev, Strategy=single-reward RL fine-tuning2026.06 | 0.29 | 21.6 | 0.3 | |
| Flow-DPPO + CPSBase Model=FLUX.1-dev, Strategy=single-reward RL fine-tuning2026.06 | 0.289 | 21.91 | 0.305 | |
| Flow-CPSBase Model=FLUX.1-dev, Strategy=single-reward RL fine-tuning2026.06 | 0.288 | 21.98 | 0.307 | |
| Flow-DPPO + CPSBase Model=FLUX2-klein-base-9B, Training Strategy=multi-reward RL fine-tuning2026.06 | 0.287 | 22.97 | 0.37 | |
| Flow-DPPO + CPSBase Model=FLUX2-klein-base-9B, Strategy=multi-reward RL fine-tuning2026.06 | 0.287 | 22.97 | 0.37 | |
| GRPO-GuardBase Model=FLUX.1-dev, Strategy=single-reward RL fine-tuning2026.06 | 0.286 | 21.03 | 0.276 | |
| Flow-DPPOBase Model=FLUX2-klein-base-9B, Training Strategy=multi-reward RL fine-tuning2026.06 | 0.282 | 22.9 | 0.368 | |
| Flow-DPPOBase Model=FLUX2-klein-base-9B, Strategy=multi-reward RL fine-tuning2026.06 | 0.282 | 22.9 | 0.368 | |
| Flow-DPPO + CPSBase Model=SD3.5-medium, Training Strategy=multi-reward RL fine-tuning2026.06 | 0.279 | 22.51 | 0.361 | |
| Flow-DPPO + CPSBase Model=SD3.5-medium, Strategy=multi-reward RL fine-tuning2026.06 | 0.279 | 22.51 | 0.361 | |
| Flow-DPPOBase Model=FLUX2-klein-base-9B, Strategy=single-reward RL fine-tuning2026.06 | 0.278 | 21.27 | 0.285 | |
| Flow-GRPOBase Model=FLUX2-klein-base-9B, Training Strategy=multi-reward RL fine-tuning2026.06 | 0.277 | 22.62 | 0.357 | |
| Flow-GRPOBase Model=FLUX2-klein-base-9B, Strategy=multi-reward RL fine-tuning2026.06 | 0.277 | 22.62 | 0.357 | |
| FLUX.1-devBase Model=FLUX.1-dev, Training Strategy=Pretrained baselines (before RL)2026.06 | 0.276 | 21.91 | 0.304 | |
| Flow-CPSBase Model=FLUX2-klein-base-9B, Training Strategy=multi-reward RL fine-tuning2026.06 | 0.276 | 22.85 | 0.364 | |
| FLUX.1-devBase Model=FLUX.1-dev, Strategy=Pretrained (before RL)2026.06 | 0.276 | 21.91 | 0.304 | |
| Flow-CPSBase Model=FLUX2-klein-base-9B, Strategy=multi-reward RL fine-tuning2026.06 | 0.276 | 22.85 | 0.364 | |
| Flow-CPSBase Model=FLUX2-klein-base-9B, Strategy=single-reward RL fine-tuning2026.06 | 0.275 | 21.15 | 0.267 | |
| Diffusion-NFTBase Model=FLUX2-klein-base-9B, Training Strategy=multi-reward RL fine-tuning2026.06 | 0.274 | 22.47 | 0.351 | |
| Diffusion-NFTBase Model=FLUX2-klein-base-9B, Strategy=multi-reward RL fine-tuning2026.06 | 0.274 | 22.47 | 0.351 | |
| Flow-GRPOBase Model=SD3.5-medium, Training Strategy=multi-reward RL fine-tuning2026.06 | 0.273 | 22.07 | 0.349 | |
| Flow-DPPOBase Model=SD3.5-medium, Training Strategy=multi-reward RL fine-tuning2026.06 | 0.273 | 22.58 | 0.36 | |
| Flow-GRPOBase Model=SD3.5-medium, Strategy=multi-reward RL fine-tuning2026.06 | 0.273 | 22.07 | 0.349 | |
| Flow-DPPOBase Model=SD3.5-medium, Strategy=multi-reward RL fine-tuning2026.06 | 0.273 | 22.58 | 0.36 | |
| GRPO-GuardBase Model=SD3.5-medium, Training Strategy=multi-reward RL fine-tuning2026.06 | 0.272 | 22.32 | 0.354 | |
| Flow-DPPO + CPSBase Model=SD3.5-medium, Strategy=single-reward RL fine-tuning2026.06 | 0.272 | 20.5 | 0.246 | |
| GRPO-GuardBase Model=SD3.5-medium, Strategy=multi-reward RL fine-tuning2026.06 | 0.272 | 22.32 | 0.354 | |
| Diffusion-NFTBase Model=SD3.5-medium, Training Strategy=multi-reward RL fine-tuning2026.06 | 0.269 | 22.52 | 0.355 | |
| GRPO-GuardBase Model=FLUX2-klein-base-9B, Training Strategy=multi-reward RL fine-tuning2026.06 | 0.269 | 21.99 | 0.349 | |
| Diffusion-NFTBase Model=SD3.5-medium, Strategy=multi-reward RL fine-tuning2026.06 | 0.269 | 22.52 | 0.355 | |
| GRPO-GuardBase Model=FLUX2-klein-base-9B, Strategy=multi-reward RL fine-tuning2026.06 | 0.269 | 21.99 | 0.349 | |
| Flow-CPSBase Model=SD3.5-medium, Training Strategy=multi-reward RL fine-tuning2026.06 | 0.265 | 22.08 | 0.343 | |
| GRPO-GuardBase Model=SD3.5-medium, Strategy=single-reward RL fine-tuning2026.06 | 0.265 | 19.94 | 0.214 | |
| Flow-DPPOBase Model=SD3.5-medium, Strategy=single-reward RL fine-tuning2026.06 | 0.265 | 20.45 | 0.253 | |
| Flow-CPSBase Model=SD3.5-medium, Strategy=multi-reward RL fine-tuning2026.06 | 0.265 | 22.08 | 0.343 | |
| Flow-DPPO + CPSBase Model=FLUX2-klein-base-9B, Strategy=single-reward RL fine-tuning2026.06 | 0.265 | 20.79 | 0.272 | |
| Flow-GRPOBase Model=FLUX2-klein-base-9B, Strategy=single-reward RL fine-tuning2026.06 | 0.264 | 20.84 | 0.28 | |
| Diffusion-NFTBase Model=SD3.5-medium, Strategy=single-reward RL fine-tuning2026.06 | 0.262 | 20.24 | 0.239 | |
| Flow-CPSBase Model=SD3.5-medium, Strategy=single-reward RL fine-tuning2026.06 | 0.26 | 19.94 | 0.22 | |
| FLUX2-klein-base-9BBase Model=FLUX2-klein-base-9B, Training Strategy=Pretrained baselines (before RL)2026.06 | 0.254 | 20.05 | 0.23 | |
| FLUX2-klein-base-9BBase Model=FLUX2-klein-base-9B, Strategy=Pretrained (before RL)2026.06 | 0.254 | 20.05 | 0.23 | |
| Flow-GRPOBase Model=SD3.5-medium, Strategy=single-reward RL fine-tuning2026.06 | 0.252 | 19.33 | 0.206 | |
| SD3.5-mediumBase Model=SD3.5-medium, Training Strategy=Pretrained baselines (before RL)2026.06 | 0.244 | 19.99 | 0.21 | |
| SD3.5-mediumBase Model=SD3.5-medium, Strategy=Pretrained (before RL)2026.06 | 0.244 | 19.99 | 0.21 | |
| GRPO-GuardBase Model=FLUX2-klein-base-9B, Strategy=single-reward RL fine-tuning2026.06 | 0.23 | 18.45 | 0.167 |