ResearchBenchmarksReinforcement Learning on Office World Map 3Follow25,222Steps to 100% SuccessQR-MAXRM-46,556.6437,948.95922,454.51,406,960.05Dec 16, 2025Evaluation ResultsMethodMethodLinksSteps to 100% SuccessQR-MAXRM2025.1225,222R-MAXRM2025.1297,639QR-MAX2025.12116,237QRM2025.12479,702R-MAX2025.12567,680Q-Learning2025.121,819,687