Reinforcement Learning on Hopper v4
27,721,263Average Returnpop-SAN
Evaluation Results
| Method | Links | |
|---|---|---|
| pop-SAN2026.02 | 27,721,263 | |
| MDC-SAN2026.02 | 3,446,131 | |
| ANNBase Algorithm=TD32026.02 | 3,410,164 | |
| ILC-SAN2026.02 | 3,403,148 | |
| PT-LIF2026.02 | 3,385,157 | |
| ANN-SNN2026.02 | 3,098,281 | |
| DSN2026.02 | 356,568 | |
| Vanilla LIF2026.02 | 352,094 | |
| S-PLIFFrame=Vanilla2026.01 | 3,462 | |
| PLIFFrame=Vanilla2026.01 | 3,414 | |
| PLIFFrame=PT2026.01 | 3,384 | |
| S-PLIFFrame=PT2026.01 | 3,380 | |
| C-DSACNumber of runs=100, Selection=Best models in training runs2026.04 | 3,352 | |
| ReLUFrame=ANN2026.01 | 3,349 | |
| PDAEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | 2,944.3 | |
| FedNPGNumber of Agents=82026.05 | 2,736 | |
| FedNPG-ADMMNumber of Agents=82026.05 | 2,719 | |
| Fixed βNumber of seeds=5, Evaluation window=last 10% of training2026.06 | 2,616 | |
| PPO-ClipNumber of seeds=5, Evaluation window=last 10% of training2026.06 | 2,598 | |
| per-sample PPO-KLNumber of seeds=5, Evaluation window=last 10% of training2026.06 | 2,598 | |
| FedNPG-ADMMNumber of Agents=42026.05 | 2,507 | |
| FedNPGNumber of Agents=22026.05 | 2,468 | |
| FedNPGNumber of Agents=42026.05 | 2,458 | |
| FedNPG-ADMMNumber of Agents=22026.05 | 2,384 | |
| PPOEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | 2,329.7 | |
| Adaptive βNumber of seeds=5, Evaluation window=last 10% of training2026.06 | 2,236 | |
| TRPOEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | 2,017 | |
| NPGEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | 1,650.8 | |
| FedNPGNumber of Agents=12026.05 | 1,644 | |
| FedNPG-ADMMNumber of Agents=12026.05 | 1,473 |