Reinforcement Learning on Cart-Pole Domain Generalization - Pole Length OpenAI Gym (3 held out domains)
175.25Average RewardRL-MLDG-GN
Evaluation Results
| Method | Links | |
|---|---|---|
| RL-MLDG-GNVariant=Gradient norm (MLDG-GN)2017.10 | 175.25 | |
| RL-MLDGVariant=Vanilla2017.10 | 165.34 | |
| RL-Random-SourceSource Training=Single random source domain2017.10 | 133.74 | |
| RL-MLDG-GCVariant=Cosine alignment (MLDG-GC)2017.10 | 129.56 | |
| RL-UndobiasArchitecture=Non-linear multi-layer network2017.10 | 113.52 | |
| RL-AllSource Training=Aggregated reward from all source domains2017.10 | 97.39 |