Offline Reinforcement Learning on Stochastic-D4RL Walker2d medium-expert
3,567.89Mean ReturnRAFMAC
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RAFMACEvaluation Steps=1000, Seeds=52025.10 | 3,567.89 | 356.2 | |
| RADACEvaluation Steps=1000, Seeds=52025.10 | 2,760.21 | 322.76 | |
| FQLEvaluation Steps=1000, Seeds=52025.10 | 2,457.68 | 448.48 | |
| RADAC2025.10 | 1,708.68 | 573.22 | |
| FQLinstantiation=Flow2025.10 | 1,309.48 | 468.15 | |
| ORAAC2025.10 | 969.62 | 358.55 | |
| ORAAC-Diff.instantiation=Diffusion2025.10 | 823.2 | 317.92 | |
| ORAACEvaluation Steps=1000, Seeds=52025.10 | 663.23 | 205.21 | |
| DiffusionQL2025.10 | 32.38 | 116.19 | |
| CODACEvaluation Steps=1000, Seeds=52025.10 | 27.56 | -35.3 | |
| CODAC2025.10 | 23.96 | 43.88 | |
| CQL2025.10 | 21.52 | 64.88 | |
| CQLEvaluation Steps=1000, Seeds=52025.10 | -10.32 | -73.38 | |
| DiffusionQLEvaluation Steps=1000, Seeds=52025.10 | -32.33 | -68.43 |