Reinforcement Learning on hopper 10-p (Normalized Return)
94.5Normalized ReturnFlex-f-DICE
Evaluation Results
| Method | Links | |
|---|---|---|
| Flex-f-DICE2026.02 | 94.5 | |
| Opti-DICE2026.02 | 89.9 | |
| Flex-f-Q2026.02 | 68.5 | |
| IQL2026.02 | 63.5 |
| Method | Links | |
|---|---|---|
| Flex-f-DICE2026.02 | 94.5 | |
| Opti-DICE2026.02 | 89.9 | |
| Flex-f-Q2026.02 | 68.5 | |
| IQL2026.02 | 63.5 |