Offline Reinforcement Learning on Walker2d Expert
211.31Episodic ReturnQDFM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| QDFMK_act=2562026.02 | 211.31 | — | |
| BCQK_act=2562026.02 | 151.19 | — | |
| AWACK_act=2562026.02 | 71.89 | — | |
| QDFM2026.02 | 4.57 | — | |
| BCQ2026.02 | 3.26 | — | |
| AWAC2026.02 | 1.53 | — | |
| AWBC2026.02 | -0.2 | — | |
| GreedyQ2026.02 | -0.3 | — | |
| CQL2026.02 | -0.31 | — | |
| AWBCK_act=2562026.02 | -7.5 | — | |
| GreedyQK_act=2562026.02 | -12.2 | — | |
| CQLK_act=2562026.02 | -12.77 | — | |
| BOSA2025.12 | — | 9.3 | |
| DARA2025.12 | — | 12.4 | |
| DVDF-IGDF2025.12 | — | 10.2 | |
| DVDF-OTDF2025.12 | — | 18.9 | |
| IGDF2025.12 | — | 13.9 | |
| IQL2025.12 | — | 8.3 | |
| OTDF2025.12 | — | 13.5 |