Reinforcement Learning Convergence on grid case 15x15
6,625.1Average Q-valuesDKDDPG
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| DKDDPGInstance=42026.03 | 6,625.1 | 31,229 | 1,575 | 39 | -3.5 | -18.4 | |
| DKDDPGInstance=32026.03 | 6,424.5 | 4,367 | 312 | 721.2 | -73.8 | -82.3 | |
| DKDDPGInstance=22026.03 | 6,233.4 | 35,171 | 1,678 | 656.6 | -21.9 | -33.2 | |
| DKDDPGInstance=Average2026.03 | 5,943.1 | 32,149 | 1,404 | 467.8 | -19.8 | -32.1 | |
| DKDDPGInstance=52026.03 | 5,243.3 | 37,934 | 1,605 | 436.9 | 2.5 | -9.4 | |
| DKDDPGInstance=12026.03 | 5,189.2 | 52,043 | 1,848 | 485.3 | -2.7 | -17 | |
| DDPGInstance=42026.03 | 4,765.2 | 32,375 | 1,931 | — | — | — | |
| DDPGInstance=Average2026.03 | 1,646.9 | 36,929 | 2,041 | — | — | — | |
| DDPGInstance=52026.03 | 976.5 | 36,994 | 1,771 | — | — | — | |
| DDPGInstance=12026.03 | 886.6 | 53,512 | 2,227 | — | — | — | |
| DDPGInstance=22026.03 | 823.9 | 45,079 | 2,513 | — | — | — | |
| DDPGInstance=32026.03 | 782.3 | 16,687 | 1,761 | — | — | — |