Offline Reinforcement Learning on D4RL MuJoCo Locomotion Domain v2
96Return (HalfCheetah, M-E)SSAR+PAR
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| SSAR+PARreplacement_strategy=PAR2026.02 | 96 | 112.7 | 111.7 | 58.5 | 102.5 | 89.3 | 49.7 | 102.6 | 95.1 | 90.9 | |
| PG2026.02 | 95.2 | 110.4 | 109.4 | 45.6 | 97.5 | 82.3 | 46.4 | 91.3 | 83.7 | 81.1 | |
| TD3+BC+PARreplacement_strategy=PAR2026.02 | 95.2 | 111.8 | 111.5 | 49.4 | 66.7 | 85.8 | 45.5 | 95.8 | 87.3 | 83.2 | |
| QIPO2026.02 | 94.5 | 108 | 110.9 | 54.2 | 94.1 | 97.3 | 48 | 101.3 | 78.6 | 87.9 | |
| EDP+PARreplacement_strategy=PAR2026.02 | 93.3 | 110.9 | 111.9 | 54.9 | 86.4 | 89.5 | 48.3 | 101.7 | 94.9 | 88.6 | |
| IQL+PARreplacement_strategy=PAR2026.02 | 93.2 | 108.3 | 111.2 | 48.4 | 71.3 | 82.5 | 44.5 | 95.7 | 82.8 | 82 | |
| RefPlan2026.02 | 92.8 | 57.8 | 114 | 74.6 | 32.8 | 91.6 | 76.3 | 82.6 | 91.2 | 78.8 | |
| TAT2026.02 | 92.5 | 109.4 | 108.8 | 44.3 | 82.6 | 81 | 39.2 | 95.3 | 78.2 | 78.9 | |
| LoMAP2026.02 | 91.1 | 110.6 | 109.2 | 45.4 | 93.7 | 79.9 | 39.1 | 97.6 | 78.7 | 82.9 | |
| FQL2026.02 | 90.1 | 86.2 | 100.5 | 60.1 | 74.5 | 72.7 | 51.1 | 85.4 | 82.1 | 78 |