Reinforcement Learning on Cheetah-Dir-E reward changes, episodic
972.4Average ReturnAda-Diffuser + DP (Oracle)
Evaluation Results
| Method | Links | |
|---|---|---|
| Ada-Diffuser + DP (Oracle)Base Algorithm=DP, Latent Factor Integration=Ada-Diffuser, Oracle Status=true2026.05 | 972.4 | |
| Ada-Diffuser + IDQL (Oracle)Base Algorithm=IDQL, Latent Factor Integration=Ada-Diffuser, Oracle Status=true2026.05 | 969.8 | |
| Ada-Diffuser + IDQLBase Algorithm=IDQL, Latent Factor Integration=Ada-Diffuser, Oracle Status=false2026.05 | 965 | |
| Ada-Diffuser + DPBase Algorithm=DP, Latent Factor Integration=Ada-Diffuser, Oracle Status=false2026.05 | 960.7 | |
| DP + DynaMITEBase Algorithm=DP, Latent Factor Integration=DynaMITE, Oracle Status=false2026.05 | 949.6 | |
| IDQL + DynaMITEBase Algorithm=IDQL, Latent Factor Integration=DynaMITE, Oracle Status=false2026.05 | 938.6 | |
| IDQLBase Algorithm=IDQL, Latent Factor Integration=None, Oracle Status=false2026.05 | 902.4 | |
| DPBase Algorithm=DP, Latent Factor Integration=None, Oracle Status=false2026.05 | 892.5 |