ResearchDatasetsWeakly communicating average-reward MDPsFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsFinding an ε-optimal policy from a single trajectoryWeakly communicating average-reward MDPs-2Sample Complexity (Exponent on ε)2
Finding an ε-optimal policy from a single trajectoryWeakly communicating average-reward MDPs-2Sample Complexity (Exponent on ε)2