ResearchBenchmarksOffline Multi-Agent Sequential Decision Making on LBF 11x11-6p-4fFollow96Win RateDLM-GRPO25.2843.646280.36Apr 26, 2026Evaluation ResultsMethodMethodLinksWin RateDLM-GRPO2026.0496DLM-SFT2026.0491MADT2026.0485OMIGA2026.0485CFCQL2026.0477MACQL2026.0469TD3+BC2026.0430BC2026.0428