Policy Customization on Ant MuJoCo (test)
6,913.15Total RewardResidual-Q
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Residual-QLearning Type=RL, Episodes=2002023.06 | 6,913.15 | 3,080.87 | 3.86 | 3,832.28 | |
| Residual-QLearning Type=IL, Episodes=2002023.06 | 6,760.4 | 3,105.7 | 3.72 | 3,654.7 | |
| Full PolicyLearning Type=RL, Episodes=2002023.06 | 6,642.35 | 3,546.07 | 3.27 | 3,096.29 | |
| GreedyLearning Type=RL, Episodes=2002023.06 | 6,373.46 | 2,528.59 | 3.86 | 3,844.87 | |
| GreedyLearning Type=IL, Episodes=2002023.06 | 6,050.26 | 1,962.4 | 4.28 | 4,087.87 | |
| Prior PolicyLearning Type=RL, Episodes=2002023.06 | 5,586.71 | 5,527.94 | 0.06 | 58.77 | |
| Prior PolicyLearning Type=IL, Episodes=2002023.06 | 5,280.65 | 4,673.23 | 0.64 | 607.42 |