Reinforcement Learning Convergence on 30x30 grid case
64,567.3Average Q-valuesDKDDPG
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| DKDDPGInstance=22026.03 | 64,567.3 | 19,087 | 362 | 206.8 | -65.6 | -49.7 | |
| DKDDPGInstance=Average2026.03 | 26,825.2 | 25,862 | 413 | 411.3 | -50.5 | -39.4 | |
| DDPGInstance=22026.03 | 21,046.2 | 55,561 | 720 | — | — | — | |
| DKDDPGInstance=32026.03 | 19,604.1 | 13,289 | 283 | 496.7 | -72.8 | -57.4 | |
| DKDDPGInstance=52026.03 | 19,145.3 | 21,992 | 396 | 262.2 | -44 | -32.1 | |
| DKDDPGInstance=42026.03 | 17,785.2 | 58,252 | 692 | 915.5 | -0.36 | -4.2 | |
| DKDDPGInstance=12026.03 | 13,024.1 | 16,689 | 332 | 175.5 | -69.7 | -53.7 | |
| DDPGInstance=Average2026.03 | 7,219.4 | 51,452 | 681 | — | — | — | |
| DDPGInstance=52026.03 | 5,286.5 | 39,259 | 583 | — | — | — | |
| DDPGInstance=12026.03 | 4,727.5 | 55,139 | 717 | — | — | — | |
| DDPGInstance=32026.03 | 3,285.4 | 48,838 | 664 | — | — | — | |
| DDPGInstance=42026.03 | 1,751.4 | 58,465 | 722 | — | — | — |