Reinforcement Learning on Double Chain
1,120Sample ComplexityTRAVEL (gener. model)
Evaluation Results
| Method | Links | |
|---|---|---|
| TRAVEL (gener. model)NE=502022.07 | 1,120 | |
| Uniform sampling (gener. model)2022.07 | 1,980 | |
| TRAVEL (gener. model)NE=1002022.07 | 2,000 | |
| TRAVEL (gener. model)NE=2002022.07 | 4,000 | |
| AceIRL (Full)NE=502022.07 | 11,580 | |
| AceIRL (Full)NE=1002022.07 | 15,440 | |
| AceIRL GreedyNE=502022.07 | 16,240 | |
| AceIRL (Full)NE=2002022.07 | 20,400 | |
| AceIRL GreedyNE=1002022.07 | 22,200 | |
| Random Exploration2022.07 | 23,640 | |
| AceIRL GreedyNE=2002022.07 | 37,200 |