ResearchBenchmarksOffline Reinforcement Learning on Antmaze v0 (test)Follow93.3Success Rate (medium play)TT+Q-3.73221.45946.6571.841May 22, 2026Evaluation ResultsMethodMethodLinksSuccess Rate (medium play)Success Rate (umaze)Success Rate (umaze diverse)Success Rate (medium diverse)Success Rate (large play)Success Rate (large diverse)TT+QVariant=Q-guided beam...Variant=Q-guided beam search2026.0593.3100—10066.760TAP+GVariant=goal-conditionedVariant=goal-conditioned2026.0578——857482LEQEvaluation protocol=Av...Evaluation protocol=Averaged over 5 seeds2026.0558.894.47146.258.660.2RAMBO2026.0516.425023.202.4COMBOSource=Reported in RAM...Source=Reported in RAMBO [S4]2026.05080.357.3000