Text-to-Image Generation on DiffusionNFT Evaluation Suite
0.95GenEval ScoreFlowGRPO (GenEval Specialist)
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| FlowGRPO (GenEval Specialist)Base Model=SD3.5-M, Optimized Reward=GenEval, CFG=true2026.05 | 0.95 | 0.66 | 22.51 | 0.293 | 0.274 | 5.32 | 1.06 | 3.18 | 0.12 | |
| DiffusionNFT (Sequential)Training Strategy=Sequential multi-stage (dagger), Base Model=SD3.5-M, CFG=true2026.05 | 0.94 | 0.91 | 23.8 | 0.293 | 0.331 | 6.01 | 1.49 | 3.49 | 1.015 | |
| MARBLETraining Strategy=Jointly optimizes all rewards, Base Model=SD3.5-M, CFG=true2026.05 | 0.94 | 0.96 | 22.83 | 0.286 | 0.355 | 6.59 | 1.53 | 3.52 | 1.116 | |
| DiffusionNFT (Simultaneous)Training Strategy=Simultaneous five-reward (double-dagger), Base Model=SD3.5-M, CFG=true2026.05 | 0.92 | 0.91 | 21.53 | 0.267 | 0.3 | 6.15 | 1.16 | 3.04 | 0.184 | |
| SD3.5-LModel Size=Large2026.05 | 0.71 | 0.68 | 22.91 | 0.289 | 0.288 | 5.5 | 0.96 | 3.25 | 0.116 | |
| FLUX.1-Dev2026.05 | 0.66 | 0.59 | 22.84 | 0.295 | 0.274 | 5.71 | 0.96 | 3.27 | 0.104 | |
| FlowGRPO (OCR Specialist)Base Model=SD3.5-M, Optimized Reward=OCR, CFG=true2026.05 | 0.66 | 0.92 | 22.41 | 0.29 | 0.28 | 5.32 | 0.95 | 3.15 | 0.013 | |
| SD3.5-M + CFGModel Size=Medium, CFG=true2026.05 | 0.63 | 0.59 | 22.34 | 0.285 | 0.279 | 5.36 | 0.85 | 3.03 | -0.255 | |
| SD-XL2026.05 | 0.55 | 0.14 | 22.42 | 0.287 | 0.28 | 5.6 | 0.76 | 2.93 | -0.455 | |
| FlowGRPO (PickScore Specialist)Base Model=SD3.5-M, Optimized Reward=PickScore, CFG=true2026.05 | 0.54 | 0.68 | 23.5 | 0.28 | 0.316 | 5.9 | 1.29 | 3.37 | 0.362 | |
| SD3.5-M (w/o CFG)Model Size=Medium, CFG=false2026.05 | 0.24 | 0.12 | 20.51 | 0.237 | 0.204 | 5.13 | -0.58 | 2.02 | -2.319 |