Preference Alignment on HPD 2.1 (test)
15.236HPSv3GCPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GCPOGeneration timestep (T)=50, Inference strategy=Hybrid (30 steps trained + 20 steps base model)2025.10 | 15.236 | 1.149 | |
| TP-GRPOGeneration timestep (T)=50, Inference strategy=Hybrid (30 steps trained + 20 steps base model)2025.10 | 15.206 | 1.148 | |
| MixGRPOGeneration timestep (T)=50, Inference strategy=Hybrid (30 steps trained + 20 steps base model)2025.10 | 15.128 | 1.146 | |
| Dance-GRPOGeneration timestep (T)=50, Inference strategy=Hybrid (30 steps trained + 20 steps base model)2025.10 | 15.08 | 1.141 | |
| Flow-GRPOGeneration timestep (T)=50, Inference strategy=Hybrid (30 steps trained + 20 steps base model)2025.10 | 14.9 | 1.135 | |
| Pref-GRPOGeneration timestep (T)=50, Inference strategy=Hybrid (30 steps trained + 20 steps base model)2025.10 | 14.868 | 1.139 | |
| FluxGeneration timestep (T)=50, Inference strategy=Hybrid (30 steps trained + 20 steps base model)2025.10 | 0.304 | 1.086 |