Offline Reinforcement Learning on Stochastic D4RL HalfCheetah (medium-expert)
5,659.4Mean ReturnRADAC
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RADACEvaluation Steps=1000, Seeds=52025.10 | 5,659.4 | 4,667.96 | |
| RAFMACEvaluation Steps=1000, Seeds=52025.10 | 5,084.12 | 3,735.37 | |
| FQLEvaluation Steps=1000, Seeds=52025.10 | 4,695.46 | 4,025.12 | |
| ORAACEvaluation Steps=1000, Seeds=52025.10 | 4,106.25 | 3,692.79 | |
| RADAC2025.10 | 916.64 | 805.25 | |
| FQLinstantiation=Flow2025.10 | 844.14 | 754.44 | |
| ORAAC2025.10 | 796.06 | 742.94 | |
| ORAAC-Diff.instantiation=Diffusion2025.10 | 650.7 | 455.4 | |
| CQL2025.10 | 66.66 | 135.39 | |
| DiffusionQL2025.10 | 20.71 | 76.39 | |
| CODAC2025.10 | 0.12 | 0.11 | |
| CODACEvaluation Steps=1000, Seeds=52025.10 | -0.12 | -1.48 | |
| CQLEvaluation Steps=1000, Seeds=52025.10 | -0.97 | -2.24 | |
| DiffusionQLEvaluation Steps=1000, Seeds=52025.10 | -118.72 | -198.01 |