ResearchBenchmarksReinforcement Learning on CarRacing v3Follow640.01Average Agent RewardPOEM-660.8636-323.136814.59352.3168Jan 21, 2026Evaluation ResultsMethodMethodLinksAverage Agent RewardPOEMEvaluation Episodes=15Evaluation Episodes=152026.01640.01PPOEvaluation Episodes=15Evaluation Episodes=152026.01-610.83