ResearchBenchmarksAdversarial Reinforcement Learning on Connect Four 50% optimal adversary (test-time)Follow0.11Average ReturnARDT-0.2956-0.1903-0.0850.0203Jul 25, 2024Evaluation ResultsMethodMethodLinksAverage ReturnARDTtest-time adversary op...test-time adversary optimality=50%2024.070.11ESPERtest-time adversary op...test-time adversary optimality=50%2024.070DTtest-time adversary op...test-time adversary optimality=50%2024.07-0.28