Multi-agent Reinforcement Learning on General-sum games
0.078Average KL DivergenceDelAC
Evaluation Results
| Method | Links | |
|---|---|---|
| DelACNumber of training steps=50,000, Discount factor=0.99, GAE Lambda=0.95, Learning rate=3 × 10−4 for actor, 3 × 10−2 for critic, PPO clip parameter=0.2, Optimization epochs=4, Batch size=256, Entropy coefficient=0, Max gradient norm=0.5, Parallel environments=42026.05 | 0.078 | |
| MAPPONumber of training steps=50,000, Discount factor=0.99, GAE Lambda=0.95, Learning rate=3 × 10−4 for actor, 3 × 10−2 for critic, PPO clip parameter=0.2, Optimization epochs=4, Batch size=256, Entropy coefficient=0, Max gradient norm=0.5, Parallel environments=42026.05 | 0.744 | |
| CA2CNumber of training steps=50,000, Discount factor=0.99, GAE Lambda=0.95, Learning rate=3 × 10−4 for actor, 3 × 10−2 for critic, PPO clip parameter=0.2, Optimization epochs=4, Batch size=256, Entropy coefficient=0, Max gradient norm=0.5, Parallel environments=42026.05 | 0.858 | |
| IA2CNumber of training steps=50,000, Discount factor=0.99, GAE Lambda=0.95, Learning rate=3 × 10−4 for actor, 3 × 10−2 for critic, PPO clip parameter=0.2, Optimization epochs=4, Batch size=256, Entropy coefficient=0, Max gradient norm=0.5, Parallel environments=42026.05 | 2.276 | |
| IPPONumber of training steps=50,000, Discount factor=0.99, GAE Lambda=0.95, Learning rate=3 × 10−4 for actor, 3 × 10−2 for critic, PPO clip parameter=0.2, Optimization epochs=4, Batch size=256, Entropy coefficient=0, Max gradient norm=0.5, Parallel environments=42026.05 | 3.343 |