Deep Reinforcement Learning on Gridworld (test)
74.2UsefulnessPPO DReST
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PPO DReSTRL Algorithm=PPO, Training Variant=DReST, Environment Steps=100 million2026.04 | 74.2 | 74.7 | |
| A2C DReSTRL Algorithm=A2C, Training Variant=DReST, Environment Steps=100 million2026.04 | 74.2 | 76.9 | |
| PPO DefaultRL Algorithm=PPO, Training Variant=Default, Environment Steps=100 million2026.04 | 66.7 | 0 | |
| A2C DefaultRL Algorithm=A2C, Training Variant=Default, Environment Steps=100 million2026.04 | 63.5 | 0 |