Continuous Control on Pendulum (Robustness Gap)
0.72Robustness GapUP(lstm)
Evaluation Results
| Method | Links | |
|---|---|---|
| UP(lstm)Context=g, Training Algorithm=DDPG, State-action history length (k)=4, Data retention fraction (alpha)=Tuned2026.04 | 0.72 | |
| UP(gru)Context=g, Training Algorithm=DDPG, State-action history length (k)=4, Data retention fraction (alpha)=Tuned2026.04 | 0.72 | |
| UP(mlp(wide))Context=g, Training Algorithm=DDPG, State-action history length (k)=4, Data retention fraction (alpha)=Tuned2026.04 | 0.8 | |
| UP(lstm)Context=l, Training Algorithm=DDPG, State-action history length (k)=4, Data retention fraction (alpha)=Tuned2026.04 | 0.84 | |
| UP(gru)Context=l, Training Algorithm=DDPG, State-action history length (k)=4, Data retention fraction (alpha)=Tuned2026.04 | 0.85 | |
| UP(mlp(narrow))Context=l, Training Algorithm=DDPG, State-action history length (k)=4, Data retention fraction (alpha)=Tuned2026.04 | 0.87 | |
| UP(mlp(narrow))Context=g, Training Algorithm=DDPG, State-action history length (k)=4, Data retention fraction (alpha)=Tuned2026.04 | 0.95 | |
| UP(mlp(wide))Context=l, Training Algorithm=DDPG, State-action history length (k)=4, Data retention fraction (alpha)=Tuned2026.04 | 1.01 | |
| UP(gru)Context=(g,l), Training Algorithm=DDPG, State-action history length (k)=4, Data retention fraction (alpha)=Tuned2026.04 | 1.11 | |
| UP(lstm)Context=(g,l), Training Algorithm=DDPG, State-action history length (k)=4, Data retention fraction (alpha)=Tuned2026.04 | 1.24 | |
| UP(mlp(wide))Context=(g,l), Training Algorithm=DDPG, State-action history length (k)=4, Data retention fraction (alpha)=Tuned2026.04 | 1.3 | |
| UP(mlp(narrow))Context=(g,l), Training Algorithm=DDPG, State-action history length (k)=4, Data retention fraction (alpha)=Tuned2026.04 | 1.49 |