Text-to-Image Generation on Multi-reward CLIP, HPSv2.1, and GenEval (test)
28.96CLIP Scorestate-aligned latent actor-critic framework
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| state-aligned latent actor-critic frameworkModel=SD1.52026.05 | 28.96 | 34.41 | 49.86 | 1.1323 | |
| GRPOModel=SD1.52026.05 | 28.11 | 34.74 | 46.88 | 1.0973 | |
| GRPOModel=SD3.5-M2026.05 | 28.03 | 33.92 | 77.05 | 1.3927 | |
| state-aligned latent actor-critic frameworkModel=SD3.5-M2026.05 | 27.72 | 31.3 | 92.41 | 1.5143 | |
| DDPOModel=SD1.52026.05 | 25.9 | 29.95 | 38.3 | 0.9415 | |
| BaseModel=SD3.5-M2026.05 | 22.75 | 17.5 | 20.13 | 0.6038 | |
| BaseModel=SD1.52026.05 | 22.5 | 17.27 | 15.58 | 0.5535 |