Online Reinforcement Learning on CheetahRun DMControl (final)
902.24Normalized ReturnGoRL(Diff)
Evaluation Results
| Method | Links | |
|---|---|---|
| GoRL(Diff)Seeds=5, Decoder=Diffusion2025.12 | 902.24 | |
| GoRL(FM)Seeds=5, Decoder=Flow-Matching2025.12 | 883.4 | |
| PPOSeeds=52025.12 | 724.83 | |
| FPOSeeds=52025.12 | 599.15 | |
| DPPOSeeds=52025.12 | 559.79 |