Mountain Car on Mountain Car held-out domains random mountain heights (test)
0Avg. Failure RateRL-MLDG-GC
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RL-MLDG-GCMeta-learning strategy=Explicit gradient direction alignment2017.10 | 0 | -311.8 | |
| RL-AllTraining Strategy=Single policy on 6 source domains in aggregation2017.10 | 5 | -141.35 | |
| RL-MLDGMeta-learning strategy=Vanilla MLDG2017.10 | 5 | -125.73 | |
| RL-UndobiasArchitecture=DG parametrised Q-network adaptation2017.10 | 8 | -124.48 | |
| RL-Random-SourceTraining Strategy=Single policy on one random source domain2017.10 | 55 | -191.07 | |
| RL-MLDG-GNMeta-learning strategy=Gradient norm2017.10 | 100 | — |