Reinforcement Learning on Ant-Dir-E reward changes, episodic
312.5Average ReturnAda-Diffuser + DP (Oracle)
Evaluation Results
| Method | Links | |
|---|---|---|
| Ada-Diffuser + DP (Oracle)Base Algorithm=DP, Latent Factor Integration=Ada-Diffuser, Oracle Status=true2026.05 | 312.5 | |
| Ada-Diffuser + IDQL (Oracle)Base Algorithm=IDQL, Latent Factor Integration=Ada-Diffuser, Oracle Status=true2026.05 | 309.6 | |
| Ada-Diffuser + IDQLBase Algorithm=IDQL, Latent Factor Integration=Ada-Diffuser, Oracle Status=false2026.05 | 295.8 | |
| Ada-Diffuser + DPBase Algorithm=DP, Latent Factor Integration=Ada-Diffuser, Oracle Status=false2026.05 | 290.4 | |
| DP + DynaMITEBase Algorithm=DP, Latent Factor Integration=DynaMITE, Oracle Status=false2026.05 | 275.2 | |
| IDQL + DynaMITEBase Algorithm=IDQL, Latent Factor Integration=DynaMITE, Oracle Status=false2026.05 | 269.3 | |
| IDQLBase Algorithm=IDQL, Latent Factor Integration=None, Oracle Status=false2026.05 | 204.6 | |
| DPBase Algorithm=DP, Latent Factor Integration=None, Oracle Status=false2026.05 | 182.5 |