Reinforcement Learning on DMC Hard
9.41Normalized Mean ReturnMinimalist phi + R2R2
Evaluation Results
| Method | Links | |
|---|---|---|
| Minimalist phi + R2R2UTD=202026.05 | 9.41 | |
| Minimalist phi (Base)UTD=202026.05 | 8.07 | |
| Minimalist phi + R2R2UTD=12026.05 | 3.73 | |
| SimbaV2 + SPL + R2R2UTD=202026.05 | 1.55 | |
| SimbaV2 + SPLUTD=202026.05 | 1.47 | |
| TD7 + R2R2UTD=202026.05 | 1.32 | |
| SimbaV2 (Base)UTD=202026.05 | 1.31 | |
| SimbaV2 + SPL + R2R2UTD=12026.05 | 1.24 | |
| SimbaV2 + SPLUTD=12026.05 | 1.23 | |
| TD7+LN + R2R2UTD=12026.05 | 1.14 | |
| TD7+LN + R2R2UTD=202026.05 | 1.13 | |
| TD7 + R2R2UTD=12026.05 | 1.05 | |
| TD7 (Base)UTD=202026.05 | 1.02 | |
| TD7 (Base)UTD=12026.05 | 1 | |
| Minimalist phi (Base)UTD=12026.05 | 1 | |
| TD7+LN (Base)UTD=12026.05 | 1 | |
| SimbaV2 (Base)UTD=12026.05 | 1 | |
| TD7+LN (Base)UTD=202026.05 | 0.86 |