ResearchDatasetsSkew-t reward distributionFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsMulti-armed bandit policy evaluationSkew-t reward distribution Δ = 0.05 1,000 MC replicates synthetic91.49Coverage (Arm1)6
Multi-armed bandit policy evaluationSkew-t reward distribution Δ = 0.05 1,000 MC replicates synthetic91.49Coverage (Arm1)6