Reinforcement Learning on walker 2-p
130.6Normalized ReturnOpti-DICE
Evaluation Results
| Method | Links | |
|---|---|---|
| Opti-DICE2026.02 | 130.6 | |
| Flex-f-DICE2026.02 | 130.3 | |
| Flex-f-Q2026.02 | 88.3 | |
| IQL2026.02 | 85.6 |
| Method | Links | |
|---|---|---|
| Opti-DICE2026.02 | 130.6 | |
| Flex-f-DICE2026.02 | 130.3 | |
| Flex-f-Q2026.02 | 88.3 | |
| IQL2026.02 | 85.6 |