Reinforcement Learning Convergence on grid case 20x20
55,113.2Average Q-valuesDKDDPG
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| DKDDPGInstance=12026.03 | 55,113.2 | 6,026 | 329 | 139.6 | -32 | -44.9 | |
| DDPGInstance=12026.03 | 22,996.4 | 8,862 | 598 | — | — | — | |
| DKDDPGInstance=Average2026.03 | 19,498.2 | 16,371 | 622 | 213.4 | -24.7 | -32.6 | |
| DKDDPGInstance=22026.03 | 15,259.6 | 6,424 | 352 | 57.3 | -41.4 | -45.6 | |
| DKDDPGInstance=52026.03 | 11,016.5 | 10,789 | 542 | 100.7 | -38 | -40.9 | |
| DDPGInstance=22026.03 | 9,702.2 | 10,958 | 647 | — | — | — | |
| DKDDPGInstance=32026.03 | 8,912.2 | 8,525 | 469 | 80.7 | -6.2 | -23.4 | |
| DDPGInstance=Average2026.03 | 8,806.1 | 19,895 | 864 | — | — | — | |
| DKDDPGInstance=42026.03 | 7,189.3 | 50,091 | 1,416 | 688.5 | -5.8 | -8.4 | |
| DDPGInstance=52026.03 | 5,488.1 | 17,405 | 918 | — | — | — | |
| DDPGInstance=32026.03 | 4,932.1 | 9,083 | 612 | — | — | — | |
| DDPGInstance=42026.03 | 911.7 | 53,167 | 1,546 | — | — | — |