ResearchDatasetsGaussian reward distributionFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsMulti-armed bandit policy evaluationGaussian reward distribution (Δ = 0.05) 1,000 MC replicates synthetic84.01Coverage (Arm1)6
Multi-armed bandit policy evaluationGaussian reward distribution (Δ = 0.05) 1,000 MC replicates synthetic84.01Coverage (Arm1)6