ResearchBenchmarksAdversarial Reinforcement Learning on Connect Four 70% optimal adversary (test)Follow0.02Average ReturnARDT-0.5936-0.4343-0.275-0.1157Jul 25, 2024Evaluation ResultsMethodMethodLinksAverage ReturnARDTtest-time adversary op...test-time adversary optimality=70%2024.070.02ESPERtest-time adversary op...test-time adversary optimality=70%2024.07-0.42DTtest-time adversary op...test-time adversary optimality=70%2024.07-0.57