ResearchBenchmarksReinforcement Learning on OpenAI Gym Ant v1Follow5,007Mean RewardNN4,5914,6994,8074,915Mar 8, 2017Evaluation ResultsMethodMethodLinksMean RewardStochastic RewardNNPolicy Architecture=Ne...Policy Architecture=Neural Network, Training Algorithm=TRPO2017.035,007—RBFPolicy Architecture=RBFPolicy Architecture=RBF2017.034,8164,297LinearPolicy Architecture=Li...Policy Architecture=Linear2017.034,6073,980