Reinforcement Learning on Four Paths
1,560Sample Complexity (Regret < 0.4)TRAVEL (gener. model)
Evaluation Results
| Method | Links | |
|---|---|---|
| TRAVEL (gener. model)NE=502022.07 | 1,560 | |
| Uniform sampling (gener. model)2022.07 | 1,900 | |
| TRAVEL (gener. model)NE=1002022.07 | 2,000 | |
| TRAVEL (gener. model)NE=2002022.07 | 4,000 | |
| AceIRL (Full)NE=502022.07 | 10,780 | |
| AceIRL (Full)NE=1002022.07 | 14,080 | |
| AceIRL (Full)NE=2002022.07 | 16,160 | |
| Random Exploration2022.07 | 17,840 | |
| AceIRL GreedyNE=502022.07 | 24,180 | |
| AceIRL GreedyNE=1002022.07 | 32,760 | |
| AceIRL GreedyNE=2002022.07 | 52,000 |