Reinforcement Learning on Task Average HC, Ant, Hop, Walk v5
7,282Mean Episodic ReturnSAID
Evaluation Results
| Method | Links | |
|---|---|---|
| SAIDDelay steps=02026.03 | 7,282 | |
| SACDelay steps=02026.03 | 6,067 | |
| SAIDDelay steps=42026.03 | 5,452 | |
| SADRDelay steps=42026.03 | 5,078 | |
| SAIDDelay steps=82026.03 | 4,478 | |
| VDPODelay steps=42026.03 | 4,425 | |
| SAIDDelay steps=162026.03 | 4,402 | |
| SADRDelay steps=82026.03 | 4,140 | |
| SADRDelay steps=162026.03 | 3,920 | |
| VDPODelay steps=82026.03 | 3,056 | |
| VDPODelay steps=162026.03 | 2,314 | |
| DRDelay steps=42026.03 | 2,247 | |
| DRDelay steps=82026.03 | 1,652 | |
| DRDelay steps=162026.03 | 753 | |
| SACDelay steps=42026.03 | 366 | |
| SACDelay steps=82026.03 | 275 | |
| SACDelay steps=162026.03 | 262 |