Reinforcement Learning on Ant v4
5,527Average ReturnS-PLIF
Evaluation Results
| Method | Links | |
|---|---|---|
| S-PLIFFrame=PT2026.01 | 5,527 | |
| C-DSACNumber of runs=100, Selection=Best models in training runs2026.04 | 5,376 | |
| PLIFFrame=PT2026.01 | 5,259 | |
| S-PLIFFrame=Vanilla2026.01 | 4,981 | |
| ReLUFrame=ANN2026.01 | 4,932 | |
| PLIFFrame=Vanilla2026.01 | 4,912 | |
| EVOMEvaluation Budget=full-budget2026.06 | 4,652.1 | |
| DDPGGamma Strategy=AdaGamma2026.05 | 3,774.19 | |
| PDAEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | 3,568.2 | |
| DDPGGamma Strategy=Fixed-γ2026.05 | 3,136.6 | |
| DDPGGamma Strategy=Uncertainty2026.05 | 2,915.64 | |
| TRPOEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | 2,807.1 | |
| PPOEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | 2,589.5 | |
| Manual PPOEvaluation Budget=full-budget2026.06 | 2,517.06 | |
| PPO-ClipNumber of seeds=5, Evaluation window=last 10% of training2026.06 | 2,193 | |
| per-sample PPO-KLNumber of seeds=5, Evaluation window=last 10% of training2026.06 | 2,193 | |
| NPGEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | 2,002.5 | |
| DDPGGamma Strategy=CrossValidate2026.05 | 1,968.91 | |
| TRPOGamma Strategy=AdaGamma2026.05 | 1,451.34 | |
| TRPOGamma Strategy=Fixed-γ2026.05 | 1,326.83 | |
| MLESEvaluation Budget=full-budget2026.06 | 1,185.26 | |
| Random SearchEvaluation Budget=full-budget2026.06 | 988.15 | |
| TRPOGamma Strategy=CrossValidate2026.05 | 940.26 | |
| TRPOGamma Strategy=Uncertainty2026.05 | 940.26 | |
| Adaptive βNumber of seeds=5, Evaluation window=last 10% of training2026.06 | 159 | |
| Fixed βNumber of seeds=5, Evaluation window=last 10% of training2026.06 | 16 |