Reinforcement Learning Convergence on grid case 10x10
3,521.4Average Q-valuesDKDDPG
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| DKDDPGInstance=52026.03 | 3,521.4 | 26,679 | 1,668 | 504.7 | 2.4 | -15.9 | |
| DKDDPGInstance=42026.03 | 3,184.5 | 11,556 | 841 | 367.4 | -4.8 | -26.7 | |
| DKDDPGInstance=32026.03 | 3,072.2 | 14,414 | 1,057 | 646.6 | -51.5 | -50.9 | |
| DKDDPGInstance=Average2026.03 | 2,991.8 | 17,182 | 1,305 | 458 | -12.1 | -27.5 | |
| DKDDPGInstance=12026.03 | 2,674.3 | 18,512 | 1,858 | 380.8 | -26.3 | -35.3 | |
| DKDDPGInstance=22026.03 | 2,506.7 | 14,751 | 1,099 | 390.7 | 19.8 | -8.5 | |
| DDPGInstance=42026.03 | 681.3 | 12,142 | 1,147 | — | — | — | |
| DDPGInstance=52026.03 | 582.3 | 26,055 | 1,983 | — | — | — | |
| DDPGInstance=12026.03 | 556.2 | 25,132 | 2,871 | — | — | — | |
| DDPGInstance=Average2026.03 | 548.4 | 21,070 | 1,872 | — | — | — | |
| DDPGInstance=22026.03 | 510.8 | 12,311 | 1,201 | — | — | — | |
| DDPGInstance=32026.03 | 411.5 | 29,712 | 2,156 | — | — | — |