ResearchBenchmarksAdversarial Reinforcement Learning on Connect Four 30% optimal adversary (test-time)Follow0.55Average ReturnARDT0.16520.26510.3650.4649Jul 25, 2024Evaluation ResultsMethodMethodLinksAverage ReturnARDTtest-time adversary op...test-time adversary optimality=30%2024.070.55ESPERtest-time adversary op...test-time adversary optimality=30%2024.070.44DTtest-time adversary op...test-time adversary optimality=30%2024.070.18