ResearchDatasetsAverage-reward Markov Decision ProcessFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsEpsilon-optimal Value EstimationAverage-reward Markov Decision Process (AMDP)—Primary metric0