Human Preference Alignment Out-of-Domain (test)
35.3HPS-v2.1TAFS-GRPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| TAFS-GRPONFE_pi_theta_old / NFE_pi_theta=4 / 3, Iteration Time (s)=1162026.02 | 35.3 | 159.5 | 3.511 | |
| DanceGRPONFE_pi_theta_old / NFE_pi_theta=25 / 14, Iteration Time (s)=6462026.02 | 33.3 | 121.2 | 3.484 | |
| MixGRPONFE_pi_theta_old / NFE_pi_theta=25 / 4, Iteration Time (s)=3342026.02 | 32.4 | 121 | 3.472 | |
| Flow-GRPONFE_pi_theta_old / NFE_pi_theta=10 / 6, Iteration Time (s)=2482026.02 | 30.4 | 103.5 | 3.46 | |
| Reward-InstructIteration Time (s)=2062026.02 | 28.6 | 97.3 | 3.392 | |
| RG-LCDIteration Time (s)=4662026.02 | 28.3 | 92.9 | 3.336 | |
| Flux.1-dev2026.02 | 28 | 84.8 | 3.328 |