Reinforcement Learning on Classic POMDP benchmark with gravity changes v0 (1.5M time steps)
2,829Ant BLT P (v0)RESeL
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| RESeL2024.05 | 2,829 | 1,971 | 2,900 | 2,678 | 2,769 | 2,480 | 2,505 | 1,901 | 2,504 | |
| GPIDE-ESS2024.05 | 2,597 | 1,017 | 2,466 | 1,886 | 2,373 | 2,537 | 1,502 | 1,701 | 2,010 | |
| PPO-GRU2024.05 | 2,103 | 690 | 1,460 | 1,072 | 1,592 | 438 | 651 | 423 | 1,053 | |
| SAC-MLP2024.05 | 1,147 | 651 | 970 | 513 | 310 | 243 | 483 | 214 | 566 | |
| A2C-GRU2024.05 | 916 | 264 | 353 | -412 | 467 | 301 | 200 | 26 | 264 | |
| TD3-MLP2024.05 | 897 | 476 | 906 | 177 | 490 | 223 | 505 | 214 | 486 | |
| SAC-Transformer2024.05 | 894 | 692 | 1,400 | -449 | 1,763 | 240 | 1,150 | 39 | 716 | |
| MF-RNN2024.05 | 352 | 1,137 | 2,802 | 2,073 | 2,234 | 1,003 | 940 | 160 | 1,462 | |
| VRM2024.05 | 323 | 291 | -1,317 | -1,443 | 557 | 476 | 372 | 216 | -190 |