Reinforcement Learning on Darkroom2 5x5 grid ε=0.4
242.2Avg Reward (AT-DPT Attacker)AT-DPT
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| AT-DPT2025.06 | 242.2 | 267.5 | 241.7 | 239.1 | 258.2 | 267.4 | |
| NPGPre-evaluation Learning Episodes=1002025.06 | 237.2 | 243.7 | 228.9 | 228.1 | 235.3 | 241.7 | |
| AT-DPTTraining Data Subset Percentage=10%2025.06 | 225.2 | 245.5 | 226.1 | 222.7 | 241.3 | 250.2 | |
| DPT2025.06 | 216.1 | 143.5 | 202.6 | 205.9 | 266.2 | 306.8 | |
| Q-learningPre-evaluation Learning Episodes=1002025.06 | 198.1 | 238.6 | 215.4 | 224.7 | 229 | 225.6 |