Reinforcement Learning Convergence on grid case 25x25
19,693.2Average Q-valuesDKDDPG
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| DKDDPGInstance=12026.03 | 19,693.2 | 38,001 | 544 | 48.3 | -28.7 | -14.2 | |
| DKDDPGInstance=42026.03 | 15,097.2 | 9,794 | 232 | 22.5 | -81.4 | -62.8 | |
| DKDDPGInstance=22026.03 | 13,952.6 | 11,799 | 276 | 211.7 | -77.1 | -56.3 | |
| DKDDPGInstance=Average2026.03 | 13,841.4 | 18,729 | 345 | 181.3 | -44.8 | -35.4 | |
| DDPGInstance=12026.03 | 13,276.5 | 53,347 | 634 | — | — | — | |
| DDPGInstance=42026.03 | 12,324.7 | 52,751 | 624 | — | — | — | |
| DKDDPGInstance=52026.03 | 10,828.3 | 23,543 | 415 | 13.4 | 45.1 | 16.9 | |
| DKDDPGInstance=32026.03 | 9,635.9 | 10,509 | 258 | 610.4 | -81.9 | -60.6 | |
| DDPGInstance=52026.03 | 9,546.1 | 16,227 | 355 | — | — | — | |
| DDPGInstance=Average2026.03 | 8,195.8 | 46,418 | 580 | — | — | — | |
| DDPGInstance=22026.03 | 4,475.4 | 51,572 | 631 | — | — | — | |
| DDPGInstance=32026.03 | 1,356.3 | 58,195 | 655 | — | — | — |