Offline Reinforcement Learning on D4RL walker2d-random v2
23.5Normalized ScorePhyB
Evaluation Results
| Method | Links | |
|---|---|---|
| PhyBModel category=Model-based2026.05 | 23.5 | |
| EPQModel category=Model-free2026.05 | 23 | |
| ADMModel category=Model-based2026.05 | 22.2 | |
| PMDB2022.10 | 21.8 | |
| PMDBN=10, k=22022.10 | 21.8 | |
| PMDBModel category=Model-based2026.05 | 21.8 | |
| Uncertainty-Aware Rank-One MIMO Q Network2026.02 | 21.3 | |
| EDAC2022.10 | 16.6 | |
| EDAC2022.10 | 16.6 | |
| MOREL2022.10 | 16 | |
| MOReL2022.10 | 16 | |
| MOReLModel category=Model-based2026.05 | 16 | |
| BEAR2026.02 | 12.8 | |
| PBRL2026.02 | 8.1 | |
| EDAC-102026.02 | 6.7 | |
| IQL2026.02 | 5.8 | |
| CQL2022.10 | 5.4 | |
| CQL2022.10 | 5.4 | |
| CQLModel category=Model-free2026.05 | 5.4 | |
| CQL2026.02 | 5.1 | |
| DMGModel category=Model-free2026.05 | 4.8 | |
| BEAR2022.10 | 4.3 | |
| BEAR2022.10 | 4.3 | |
| BCQ2026.02 | 4.2 | |
| MOPO2026.02 | 4.2 | |
| FQLModel category=Model-free2026.05 | 4.1 | |
| UWAV2026.02 | 2 | |
| TD3-BC2026.02 | 1.6 | |
| TD3+BCModel category=Model-free2026.05 | 1.4 | |
| BC2022.10 | 1.3 | |
| BRAC2022.10 | 1.3 | |
| BC2022.10 | 1.3 | |
| BRAC2022.10 | 1.3 | |
| RAMBO2022.10 | 0 | |
| RAMBOModel category=Model-based2026.05 | 0 |