In-Context Reinforcement Learning on Miniworld environment ε = 0.4 (test)
123.5Average Episode RewardPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| PPOAttacker Type=Clean Env.2025.06 | 123.5 | |
| AT-DPTAttacker Type=DPT2025.06 | 116.8 | |
| AT-DPTAttacker Type=Clean Env.2025.06 | 112.7 | |
| DPTAttacker Type=Clean Env.2025.06 | 110 | |
| AT-DPTAttacker Type=Unif. Rand. Attack2025.06 | 108.6 | |
| AT-DPTAttacker Type=AT-DPT2025.06 | 104.8 | |
| DPTAttacker Type=Unif. Rand. Attack2025.06 | 102.7 | |
| PPOAttacker Type=Unif. Rand. Attack2025.06 | 92.9 | |
| PPOAttacker Type=DPT2025.06 | 83.8 | |
| PPOAttacker Type=AT-DPT2025.06 | 83.5 | |
| DPTAttacker Type=AT-DPT2025.06 | 81.2 | |
| DPTAttacker Type=DPT2025.06 | 70.2 |