Reinforcement Learning on AdroitHandDoor v1
1,725Average ReturnCausal PBRS
Evaluation Results
| Method | Links | |
|---|---|---|
| Causal PBRSState Dim Removed=12026.02 | 1,725 | |
| T-REXState Dim Removed=12026.02 | 1,659 | |
| SAC BaselineState Dim Removed=12026.02 | 1,472 | |
| Causal PBRSState Dim Removed=12026.02 | 1,289 | |
| CQLState Dim Removed=12026.02 | 415 | |
| CQLState Dim Removed=12026.02 | 308 | |
| TrexState Dim Removed=12026.02 | 105 | |
| BaselineState Dim Removed=12026.02 | 71 | |
| Recurrent SACState Dim Removed=12026.02 | -27 | |
| Recurrent SACState Dim Removed=12026.02 | -27 | |
| Log-barrier DDPG2025.09 | -36 | |
| DDPG2025.09 | -39.3 |