ResearchBenchmarksReinforcement Learning on RTFM two-monster SL ShuffleFollow83Average Win RateOracle MCTS6.0426.024665.98Jun 21, 2026Evaluation ResultsMethodMethodLinksAverage Win RateOracle MCTS2026.0683HRLLI2026.0655Reader2026.0647ReaderArchitecture=TransformerArchitecture=Transformer2026.0639txt2πParameters=100MParameters=100M2026.0624txt2π2026.069