ResearchBenchmarksReinforcement Learning on Pusher2DFollow102.65Rewardπ-PRL77.658884.146990.63597.1231May 18, 2026Evaluation ResultsMethodMethodLinksRewardπ-PRLPolicy Type=DiscretizedPolicy Type=Discretized2026.05102.65VIPER (PPO)2026.0587.85PPO2026.0587.07π-PRLPolicy Type=Continuous...Policy Type=Continuous relaxed2026.0582.44π-PRLPolicy Type=Fine-tunedPolicy Type=Fine-tuned2026.0580.36DTSemNets2026.0579.13DiPRL2026.0578.62