Offline Reinforcement Learning on Stochastic-D4RL HalfCheetah medium-replay
2,696.61Mean ReturnRAFMAC
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RAFMACEvaluation Steps=1000, Seeds=52025.10 | 2,696.61 | 1,499.8 | |
| RADACEvaluation Steps=1000, Seeds=52025.10 | 2,674.72 | 1,401.03 | |
| DiffusionQLEvaluation Steps=1000, Seeds=52025.10 | 2,261.16 | 1,439.77 | |
| FQLEvaluation Steps=1000, Seeds=52025.10 | 1,909.57 | 568.43 | |
| RADAC2025.10 | 525.84 | 278.65 | |
| FQLinstantiation=Flow2025.10 | 434.33 | 224.73 | |
| ORAACEvaluation Steps=1000, Seeds=52025.10 | 315.87 | 161.54 | |
| DiffusionQL2025.10 | 279.95 | 79.93 | |
| ORAAC-Diff.instantiation=Diffusion2025.10 | 220 | 44.93 | |
| CQL2025.10 | 66.21 | 127.09 | |
| ORAAC2025.10 | 18.99 | 34.09 | |
| CODAC2025.10 | 0.11 | 1.47 | |
| CODACEvaluation Steps=1000, Seeds=52025.10 | -0.12 | -1.48 | |
| CQLEvaluation Steps=1000, Seeds=52025.10 | -38.85 | -40.23 |