Reinforcement Learning on Gym MuJoCo + DMC-Hard
6.2Normalized Mean ReturnMinimalist phi + R2R2
Evaluation Results
| Method | Links | |
|---|---|---|
| Minimalist phi + R2R2UTD=202026.05 | 6.2 | |
| Minimalist phi (Base)UTD=202026.05 | 5.28 | |
| Minimalist phi + R2R2UTD=12026.05 | 2.74 | |
| SimbaV2 + SPL + R2R2UTD=202026.05 | 1.38 | |
| SimbaV2 + SPLUTD=202026.05 | 1.34 | |
| TD7 + R2R2UTD=202026.05 | 1.24 | |
| SimbaV2 (Base)UTD=202026.05 | 1.2 | |
| SimbaV2 + SPLUTD=12026.05 | 1.16 | |
| SimbaV2 + SPL + R2R2UTD=12026.05 | 1.15 | |
| TD7+LN + R2R2UTD=202026.05 | 1.1 | |
| TD7+LN + R2R2UTD=12026.05 | 1.08 | |
| TD7 + R2R2UTD=12026.05 | 1.06 | |
| TD7 (Base)UTD=202026.05 | 1.02 | |
| TD7 (Base)UTD=12026.05 | 1 | |
| Minimalist phi (Base)UTD=12026.05 | 1 | |
| TD7+LN (Base)UTD=12026.05 | 1 | |
| SimbaV2 (Base)UTD=12026.05 | 1 | |
| TD7+LN (Base)UTD=202026.05 | 0.88 |