ResearchBenchmarksMulti-Objective Reinforcement Learning on QueueFollow1.6MERHEURISTIC0.69446.807212.9219.0328Mar 24, 2026Evaluation ResultsMethodMethodLinksMERSuccess Rate (%)HEURISTIC2026.031.610.05ENVELOPE2026.033.5425.1DPIAlgorithm=Q-learningAlgorithm=Q-learning2026.033.7429.09FIXED2026.034.1910.05RS2026.034.2911.43SR-PPO2026.035.6446.91DPIAlgorithm=PPOAlgorithm=PPO2026.0310.3439.95DPI-PPO2026.0310.3439.95Dense Oracle2026.0314.4149.27MER-PPO2026.0315.010.98RANDOM2026.0324.2417.25