Offline Reinforcement Learning on D4RL MuJoCo v2 (Medium, Medium-Replay, Medium-Expert Configurations)
68.2HalfCheetah Medium v2 ScoreSAC-N
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| SAC-N2026.05 | 68.2 | 60.7 | 99 | 40.8 | 100.3 | 101.3 | 87.5 | 79 | 114.9 | 83.5 | |
| EDAC2026.05 | 67.7 | 62.1 | 104.8 | 101.7 | 99.7 | 105.2 | 93.4 | 87.1 | 114.8 | 92.9 | |
| ReBRAC2026.05 | 64 | 51.2 | 103.8 | 102.3 | 95 | 109.5 | 85.8 | 84.2 | 111.9 | 89.7 | |
| UNIQSteps=1M2026.05 | 48.9 | 46 | 94.8 | 75.6 | 101.6 | 111.8 | 85.5 | 89.4 | 112.9 | 85.2 | |
| IQL2026.05 | 48.3 | 44.5 | 94.7 | 67.5 | 97.4 | 107.4 | 80.9 | 82.2 | 111.7 | 81.6 | |
| TD3+BC2026.05 | 48.1 | 44.8 | 90.8 | 60.4 | 64.4 | 101.2 | 82.7 | 85.6 | 110 | 76.4 | |
| CQL2026.05 | 47 | 45 | 95.6 | 59.1 | 95.1 | 99.3 | 80.8 | 73.1 | 109.6 | 78.3 | |
| BC2026.05 | 42.4 | 35.7 | 55.9 | 53.5 | 29.8 | 52.3 | 63.2 | 21.8 | 99 | 50.4 | |
| DT2026.05 | 42.2 | 38.9 | 91.6 | 65.1 | 81.8 | 110.4 | 67.6 | 59.9 | 107.1 | 73.8 |