Offline Reinforcement Learning on Stochastic-D4RL Walker2d medium-replay
778Mean ReturnRAFMAC
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RAFMACEvaluation Steps=1000, Seeds=52025.10 | 778 | 7.92 | |
| FQLEvaluation Steps=1000, Seeds=52025.10 | 647.33 | -29.64 | |
| RADAC2025.10 | 615.94 | 145.21 | |
| FQLinstantiation=Flow2025.10 | 411.36 | 5.08 | |
| RADACEvaluation Steps=1000, Seeds=52025.10 | 383.87 | -309.7 | |
| ORAACEvaluation Steps=1000, Seeds=52025.10 | 160.23 | -359.49 | |
| ORAAC2025.10 | 126.94 | 203.64 | |
| DiffusionQL2025.10 | 96.88 | 48.14 | |
| CODAC2025.10 | 33.59 | 52.63 | |
| CODACEvaluation Steps=1000, Seeds=52025.10 | 26.39 | -36.56 | |
| CQL2025.10 | 16.9 | 51.49 | |
| ORAAC-Diff.instantiation=Diffusion2025.10 | 4.62 | 113.2 | |
| CQLEvaluation Steps=1000, Seeds=52025.10 | -14.68 | -95.3 | |
| DiffusionQLEvaluation Steps=1000, Seeds=52025.10 | -23.5 | -53.55 |