ResearchBenchmarksReinforcement Learning on RTFM two-monster, NLFollow83Average Win RateOracle MCTS3.9624.484565.52Jun 21, 2026Evaluation ResultsMethodMethodLinksAverage Win RateOracle MCTS2026.0683HRLLI2026.0630txt2πParameters=100MParameters=100M2026.0624Reader2026.0624ReaderArchitecture=TransformerArchitecture=Transformer2026.0623txt2π2026.067