Reinforcement Learning on Gym MuJoCo
1.1Normalized Mean ReturnSimbaV2 + SPL
Evaluation Results
| Method | Links | |
|---|---|---|
| SimbaV2 + SPLUTD=202026.05 | 1.1 | |
| TD7 + R2R2UTD=202026.05 | 1.09 | |
| TD7 + R2R2UTD=12026.05 | 1.08 | |
| SimbaV2 + SPL + R2R2UTD=202026.05 | 1.08 | |
| TD7+LN + R2R2UTD=202026.05 | 1.05 | |
| SimbaV2 + SPLUTD=12026.05 | 1.03 | |
| TD7 (Base)UTD=202026.05 | 1.02 | |
| SimbaV2 (Base)UTD=202026.05 | 1.01 | |
| TD7 (Base)UTD=12026.05 | 1 | |
| Minimalist phi (Base)UTD=12026.05 | 1 | |
| Minimalist phi + R2R2UTD=12026.05 | 1 | |
| TD7+LN (Base)UTD=12026.05 | 1 | |
| SimbaV2 (Base)UTD=12026.05 | 1 | |
| SimbaV2 + SPL + R2R2UTD=12026.05 | 0.99 | |
| TD7+LN + R2R2UTD=12026.05 | 0.98 | |
| TD7+LN (Base)UTD=202026.05 | 0.9 | |
| Minimalist phi + R2R2UTD=202026.05 | 0.57 | |
| Minimalist phi (Base)UTD=202026.05 | 0.41 |