Offline Reinforcement Learning on Stochastic-D4RL Hopper-medium-replay
453.64Mean ReturnRADAC
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RADACEvaluation Steps=1000, Seeds=52025.10 | 453.64 | -87.04 | |
| FQLEvaluation Steps=1000, Seeds=52025.10 | 448.26 | -33.21 | |
| RADAC2025.10 | 385.58 | 8.16 | |
| FQLinstantiation=Flow2025.10 | 373.16 | 62.24 | |
| RAFMACEvaluation Steps=1000, Seeds=52025.10 | 350.36 | -36.69 | |
| CODAC2025.10 | 47.83 | 160.08 | |
| ORAAC-Diff.instantiation=Diffusion2025.10 | 25.68 | 131.91 | |
| ORAAC2025.10 | 18 | 129.25 | |
| CQL2025.10 | 16.25 | 118.7 | |
| CODACEvaluation Steps=1000, Seeds=52025.10 | 3.61 | -105.41 | |
| DiffusionQL2025.10 | 2.79 | 51.33 | |
| CQLEvaluation Steps=1000, Seeds=52025.10 | 2.28 | -130.48 | |
| DiffusionQLEvaluation Steps=1000, Seeds=52025.10 | -22.15 | -163.82 | |
| ORAACEvaluation Steps=1000, Seeds=52025.10 | -30 | -179.92 |