Continuous Control on DM Control reacher-hard
0.9705Average RewardMEOW
Evaluation Results
| Method | Links | |
|---|---|---|
| MEOWTraining timesteps=1M, Seeds=52025.09 | 0.9705 | |
| SACTraining timesteps=1M, Seeds=52025.09 | 0.9637 | |
| FQLTraining timesteps=1M, Seeds=52025.09 | 0.9624 | |
| TD3Training timesteps=1M, Seeds=52025.09 | 0.9497 | |
| TD-MPC2Environment Steps=1M2026.07 | 0.9156 | |
| RC-SACtraining steps=50 [k], seeds=3, w_target=0.52026.03 | 0.91 | |
| SACtraining steps=50 [k], seeds=3, w_target=0.52026.03 | 0.9 | |
| MIST-WMEnvironment Steps=1M2026.07 | 0.8716 | |
| Factored DreamerEnvironment Steps=1M2026.07 | 0.8693 | |
| RC-TD3training steps=50 [k], seeds=3, w_target=0.52026.03 | 0.82 | |
| TD3training steps=50 [k], seeds=3, w_target=0.52026.03 | 0.76 | |
| DDPGTraining timesteps=1M, Seeds=52025.09 | 0.758 | |
| Dreamer-v3Environment Steps=1M2026.07 | 0.7024 | |
| DINO-WMEnvironment Steps=1M2026.07 | 0.3462 |