ResearchDatasetsStudent-t reward distributionFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsMulti-armed bandit policy evaluationStudent-t reward distribution Δ = 0.05 synthetic (1,000 MC replicates)81.29Coverage (Arm1)6
Multi-armed bandit policy evaluationStudent-t reward distribution Δ = 0.05 synthetic (1,000 MC replicates)81.29Coverage (Arm1)6