Offline Reinforcement Learning on Stochastic-D4RL Hopper (medium-expert)
1,513.27Mean RewardRADAC
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RADACEvaluation Steps=1000, Seeds=52025.10 | 1,513.27 | 967.21 | |
| RADAC2025.10 | 1,277.74 | 800.64 | |
| ORAAC2025.10 | 714.15 | 374.63 | |
| ORAACEvaluation Steps=1000, Seeds=52025.10 | 660.07 | 400.84 | |
| ORAAC-Diff.instantiation=Diffusion2025.10 | 577.73 | 240.48 | |
| FQLEvaluation Steps=1000, Seeds=52025.10 | 393.64 | 77.93 | |
| RAFMACEvaluation Steps=1000, Seeds=52025.10 | 370.11 | -120.09 | |
| FQLinstantiation=Flow2025.10 | 341.16 | 8.8 | |
| DiffusionQL2025.10 | 279.97 | 872.95 | |
| CQLEvaluation Steps=1000, Seeds=52025.10 | 43.22 | -65.9 | |
| CODACEvaluation Steps=1000, Seeds=52025.10 | 31.59 | -77.88 | |
| CODAC2025.10 | 26.59 | 150.92 | |
| CQL2025.10 | 25.87 | 111.37 | |
| DiffusionQLEvaluation Steps=1000, Seeds=52025.10 | -38.75 | -212.49 |