Offline Reinforcement Learning on D4RL (Hopper, Walker2d, Ant, Humanoid)
3,275Hopper ScoreDPPO
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| DPPO2026.04 | 3,275 | 3,897 | 3,951 | 4,873 | |
| ReinFlow-S2026.04 | 3,253 | 4,202 | 4,119 | 4,956 | |
| ScoRe-Flow2026.04 | 3,235 | 4,189 | 4,096 | 5,125 | |
| ReinFlow-R2026.04 | 3,204 | 4,092 | 4,021 | 4,976 | |
| Score-SDE2026.04 | 3,155 | 3,922 | 3,975 | 4,928 | |
| FQL2026.04 | 3,032 | 3,709 | 620 | 2,334 |