ResearchBenchmarksMulti-Objective Reinforcement Learning on MazeFollow223.55Mean Episode Reward (MER)RANDOM-5.14654.227113.6172.973Mar 24, 2026Evaluation ResultsMethodMethodLinksMean Episode Reward (MER)Success Rate (SR)RANDOM2026.03223.550MER-PPO2026.0385.550.05Dense Oracle2026.0340.3362.92DPIAlgorithm=PPOAlgorithm=PPO2026.0330.1659.04DPI-PPO2026.0330.1659.04DPIAlgorithm=Q-learningAlgorithm=Q-learning2026.0327.3542.94RS2026.0323.660.01FIXED2026.0316.151.12SR-PPO2026.0315.2861.13ENVELOPE2026.0310.360.01HEURISTIC2026.033.650