Reward Conditioning (RC) on Maze2D (test)
2.74RewardUni[MASK] - multi-task + finetune
Evaluation Results
| Method | Links | |
|---|---|---|
| Uni[MASK] - multi-task + finetuneContext Length=52022.11 | 2.74 | |
| Uni[MASK] - finetuneContext Length=52022.11 | 2.73 | |
| Decision-GPTContext Length=102022.11 | 2.73 | |
| Uni[MASK] - multi-task (BC & RC)Context Length=52022.11 | 2.68 | |
| Uni[MASK] - single-taskContext Length=52022.11 | 2.64 | |
| Uni[MASK] - finetuneContext Length=102022.11 | 2.61 | |
| Uni[MASK] - multi-task + finetuneContext Length=102022.11 | 2.42 | |
| Uni[MASK] - single-taskContext Length=102022.11 | 2.41 | |
| Uni[MASK] - multi-task (BC & RC)Context Length=102022.11 | 2.39 | |
| Decision-GPTContext Length=52022.11 | 2.32 | |
| Uni[MASK] - random-maskContext Length=102022.11 | 2.31 | |
| Uni[MASK] - random-maskContext Length=52022.11 | 2.2 | |
| Feedforward Neural NetworkContext Length=102022.11 | 1.88 | |
| Decision TransformerContext Length=102022.11 | 1.7 | |
| Feedforward Neural NetworkContext Length=52022.11 | 1.53 | |
| Decision TransformerContext Length=52022.11 | 1.49 |