Reinforcement Learning on Swimmer
260.35Average ReturnsR2PO
Evaluation Results
| Method | Links | |
|---|---|---|
| R2PONumber of runs=10, Aggregation protocol=averaged across all training iterations2026.05 | 260.35 | |
| CG-FPDNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 247.54 | |
| DF-CWP-CPNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 219.82 | |
| ProPS+Number of runs=10, Aggregation protocol=averaged across all training iterations2026.05 | 162.05 | |
| DACERTraining Steps=1M2026.03 | 116 | |
| QSMTraining Steps=1M2026.03 | 108 | |
| PPONumber of training seeds=5, Number of evaluation episodes=1002026.03 | 95 | |
| ProPSNumber of runs=10, Aggregation protocol=averaged across all training iterations2026.05 | 89.22 | |
| TD3Training Steps=1M2026.03 | 88 | |
| SACNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 87.84 | |
| SACTraining Steps=1M2026.03 | 85 | |
| QVPOTraining Steps=1M2026.03 | 83 | |
| SiMPO-ExpTraining Steps=1M2026.03 | 69 | |
| SiMPO-LinearTraining Steps=1M2026.03 | 68 | |
| SiMPO-Lin. Neg.Training Steps=1M2026.03 | 66 | |
| SiMPO-SquareTraining Steps=1M2026.03 | 52 | |
| A2CNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 49.08 | |
| DIPOTraining Steps=1M2026.03 | 46 | |
| TRPONumber of runs=10, Aggregation protocol=averaged across all training iterations, Source=Best SB32026.05 | 44.6 | |
| SMACbatch size=1000, seeds=52026.01 | 28.5 | |
| AC-KFACbatch size=1000, seeds=52026.01 | 24.2 | |
| AC-CGbatch size=1000, seeds=52026.01 | 23.8 | |
| AC-Adambatch size=1000, seeds=52026.01 | 17.3 | |
| AC-SGDbatch size=1000, seeds=52026.01 | 12.4 |