ResearchBenchmarksOffline Multi-Agent Reinforcement Learning on SMACFollow973s5z Win RateDLM-GRPO1.3226.165175.84Apr 26, 2026Evaluation ResultsMethodMethodLinks3s5z Win Rate10m_vs_11m Win Rate5m_vs_6m Win Rate3s_vs_5z Win Rate6h_vs_8z Win RateCORRIDOR Win RateDLM-GRPOType=LLM-based, Traini...Type=LLM-based, Training Stage=GRPO2026.049710080947592DLM-SFTType=LLM-based, Traini...Type=LLM-based, Training Stage=SFT2026.04949872846781MADTType=LLM-basedType=LLM-based2026.04818867725364GATOType=LLM-basedType=LLM-based2026.04729263653756SAYCANType=LLM-basedType=LLM-based2026.045107820