Offline Reinforcement Learning on Walker2D Medium-Replay JointNoise Shift
82.363Average ReturnREAG*MV
Evaluation Results
| Method | Links | |
|---|---|---|
| REAG*MVFramework=QT2024.10 | 82.363 | |
| 1T10SFramework=QT2024.10 | 82.139 | |
| REAG*DaraFramework=QT2024.10 | 79.795 | |
| REAG*DaraFramework=DT2024.10 | 62.226 | |
| 1T10SFramework=DT2024.10 | 58.255 | |
| REAG*MVFramework=DT2024.10 | 55.722 | |
| REAG*DaraFramework=Reinformer2024.10 | 55.438 | |
| 1T10SFramework=Reinformer2024.10 | 54.801 | |
| REAG*MVFramework=Reinformer2024.10 | 47.591 |