Multi-agent Reinforcement Learning on GMP(omega=0.5)
0.001Avg KL DivergenceDelAC
Evaluation Results
| Method | Links | |
|---|---|---|
| DelACNumber of training steps=50,000, Discount factor=0.99, GAE Lambda=0.95, Learning rate=3 × 10−4 for actor, 3 × 10−2 for critic, PPO clip parameter=0.2, Optimization epochs=4, Batch size=256, Entropy coefficient=0, Max gradient norm=0.5, Parallel environments=42026.05 | 0.001 | |
| MAPPONumber of training steps=50,000, Discount factor=0.99, GAE Lambda=0.95, Learning rate=3 × 10−4 for actor, 3 × 10−2 for critic, PPO clip parameter=0.2, Optimization epochs=4, Batch size=256, Entropy coefficient=0, Max gradient norm=0.5, Parallel environments=42026.05 | 1.005 | |
| CA2CNumber of training steps=50,000, Discount factor=0.99, GAE Lambda=0.95, Learning rate=3 × 10−4 for actor, 3 × 10−2 for critic, PPO clip parameter=0.2, Optimization epochs=4, Batch size=256, Entropy coefficient=0, Max gradient norm=0.5, Parallel environments=42026.05 | 1.128 | |
| IA2CNumber of training steps=50,000, Discount factor=0.99, GAE Lambda=0.95, Learning rate=3 × 10−4 for actor, 3 × 10−2 for critic, PPO clip parameter=0.2, Optimization epochs=4, Batch size=256, Entropy coefficient=0, Max gradient norm=0.5, Parallel environments=42026.05 | 1.303 | |
| IPPONumber of training steps=50,000, Discount factor=0.99, GAE Lambda=0.95, Learning rate=3 × 10−4 for actor, 3 × 10−2 for critic, PPO clip parameter=0.2, Optimization epochs=4, Batch size=256, Entropy coefficient=0, Max gradient norm=0.5, Parallel environments=42026.05 | 2.591 |