ResearchBenchmarksReinforcement Learning on Office World Map 1Follow7,312Training StepsQR-MAXRM-11,776.64117,071.68245,920374,768.32Dec 16, 2025Evaluation ResultsMethodMethodLinksTraining StepsQR-MAXRM2025.127,312R-MAXRM2025.1226,776QR-MAX2025.1231,316R-MAX2025.12136,622QRM2025.12137,263Q-Learning2025.12484,528