ResearchBenchmarksReinforcement Learning on Ant RandomGoalFollow413.12RewardDiPRL164.7264229.2132293.7358.1868May 18, 2026Evaluation ResultsMethodMethodLinksRewardDiPRL2026.05413.12π-PRLPolicy Type=Continuous...Policy Type=Continuous relaxed2026.05336.56VIPER (PPO)2026.05328.89DTSemNets2026.05313.47π-PRLPolicy Type=Fine-tunedPolicy Type=Fine-tuned2026.05264.75π-PRLPolicy Type=DiscretizedPolicy Type=Discretized2026.05237.05PPO2026.05174.28