ResearchBenchmarksReinforcement Learning on RTFM two-monster SLFollow83Average Win RateOracle MCTS6.0426.024665.98Jun 21, 2026Evaluation ResultsMethodMethodLinksAverage Win RateOracle MCTS2026.0683HRLLI2026.0660Reader2026.0650ReaderArchitecture=TransformerArchitecture=Transformer2026.0650txt2πParameters=100MParameters=100M2026.0624txt2π2026.069