Multi-agent Reinforcement Learning on Zero-sum games
0.001Average KL DivergenceDelAC
Evaluation Results
| Method | Links | |
|---|---|---|
| DelACNumber of training steps=50,000, Discount factor=0.99, GAE Lambda=0.95, Learning rate=3 × 10−4 for actor, 3 × 10−2 for critic, PPO clip parameter=0.2, Optimization epochs=4, Batch size=256, Entropy coefficient=0, Max gradient norm=0.5, Parallel environments=42026.05 | 0.001 | |
| MAPPONumber of training steps=50,000, Discount factor=0.99, GAE Lambda=0.95, Learning rate=3 × 10−4 for actor, 3 × 10−2 for critic, PPO clip parameter=0.2, Optimization epochs=4, Batch size=256, Entropy coefficient=0, Max gradient norm=0.5, Parallel environments=42026.05 | 0.301 | |
| CA2CNumber of training steps=50,000, Discount factor=0.99, GAE Lambda=0.95, Learning rate=3 × 10−4 for actor, 3 × 10−2 for critic, PPO clip parameter=0.2, Optimization epochs=4, Batch size=256, Entropy coefficient=0, Max gradient norm=0.5, Parallel environments=42026.05 | 0.363 | |
| IA2CNumber of training steps=50,000, Discount factor=0.99, GAE Lambda=0.95, Learning rate=3 × 10−4 for actor, 3 × 10−2 for critic, PPO clip parameter=0.2, Optimization epochs=4, Batch size=256, Entropy coefficient=0, Max gradient norm=0.5, Parallel environments=42026.05 | 1.584 | |
| IPPONumber of training steps=50,000, Discount factor=0.99, GAE Lambda=0.95, Learning rate=3 × 10−4 for actor, 3 × 10−2 for critic, PPO clip parameter=0.2, Optimization epochs=4, Batch size=256, Entropy coefficient=0, Max gradient norm=0.5, Parallel environments=42026.05 | 2.379 |