Offline Reinforcement Learning on Hopper Medium-Replay 1T10S
93.704Average ReturnQT
Evaluation Results
| Method | Links | |
|---|---|---|
| QTDistribution Shift=JointNoise (JN), Base Architecture=QT2024.10 | 93.704 | |
| REAG*MVDistribution Shift=JointNoise (JN), Base Architecture=QT2024.10 | 93.409 | |
| REAG*DaraDistribution Shift=JointNoise (JN), Base Architecture=DT2024.10 | 83.525 | |
| REAG*DaraDistribution Shift=BodyMass (BM), Base Architecture=QT2024.10 | 82.786 | |
| REAG*MVDistribution Shift=JointNoise (JN), Base Architecture=DT2024.10 | 77.825 | |
| REAG*MVDistribution Shift=BodyMass (BM), Base Architecture=QT2024.10 | 76.287 | |
| QTDistribution Shift=BodyMass (BM), Base Architecture=QT2024.10 | 69.46 | |
| REAG*MVDistribution Shift=BodyMass (BM), Base Architecture=DT2024.10 | 66.092 | |
| DTDistribution Shift=BodyMass (BM), Base Architecture=DT2024.10 | 64.216 | |
| DTDistribution Shift=JointNoise (JN), Base Architecture=DT2024.10 | 61.87 | |
| REAG*DaraDistribution Shift=BodyMass (BM), Base Architecture=DT2024.10 | 60.393 | |
| REAG*DaraDistribution Shift=JointNoise (JN), Base Architecture=Reinformer2024.10 | 52.052 | |
| REAG*DaraDistribution Shift=JointNoise (JN), Base Architecture=QT2024.10 | 51.456 | |
| REAG*MVDistribution Shift=JointNoise (JN), Base Architecture=Reinformer2024.10 | 43.985 | |
| ReinformerDistribution Shift=JointNoise (JN), Base Architecture=Reinformer2024.10 | 41.82 | |
| REAG*DaraDistribution Shift=BodyMass (BM), Base Architecture=Reinformer2024.10 | 27.238 | |
| REAG*MVDistribution Shift=BodyMass (BM), Base Architecture=Reinformer2024.10 | 20.952 | |
| ReinformerDistribution Shift=BodyMass (BM), Base Architecture=Reinformer2024.10 | 17.534 |