Backdoor Attack on Reinforcement Learning on Breakout Discrete (evaluation)
495.2Baseline RewardTrojDRL
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| TrojDRLTarget Action=No-Op, Agent Architecture=PPO, Action Space=Discrete, Trajectories=100, Training Seeds=52026.02 | 495.2 | 98.5 | 2 | 58.6 | |
| SleeperNetsTarget Action=No-Op, Agent Architecture=PPO, Action Space=Discrete, Trajectories=100, Training Seeds=52026.02 | 489.6 | 100 | 0 | 25.9 | |
| No PoisoningAgent Architecture=PPO, Action Space=Discrete, Trajectories=100, Training Seeds=52026.02 | 476.5 | — | — | 9.4 | |
| DazeTarget Action=No-Op, Agent Architecture=PPO, Action Space=Discrete, Trajectories=100, Training Seeds=52026.02 | 465.6 | 97.6 | 0.1 | 31.1 | |
| Q-InceptTarget Action=No-Op, Agent Architecture=PPO, Action Space=Discrete, Trajectories=100, Training Seeds=52026.02 | 456.1 | 100 | 0 | 19.7 |