Human Preference Alignment on In-Domain (test)
22.46Pick ScoreTAFS-GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TAFS-GRPONFE_pi_theta_old / NFE_pi_theta=4 / 3, Iteration Time (s)=1162026.02 | 22.46 | 27.68 | |
| Flow-GRPONFE_pi_theta_old / NFE_pi_theta=10 / 6, Iteration Time (s)=2482026.02 | 22.26 | 27.72 | |
| MixGRPONFE_pi_theta_old / NFE_pi_theta=25 / 4, Iteration Time (s)=3342026.02 | 22.23 | 27.67 | |
| DanceGRPONFE_pi_theta_old / NFE_pi_theta=25 / 14, Iteration Time (s)=6462026.02 | 22.2 | 27.42 | |
| Reward-InstructIteration Time (s)=2062026.02 | 22.13 | 27.23 | |
| RG-LCDIteration Time (s)=4662026.02 | 21.97 | 26.98 | |
| Flux.1-dev2026.02 | 21.68 | 25.95 |