ResearchDatasetsHead-QAFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsReinforcement Learning from Verifiable RewardsHEAD-QA100AR30Medical Multiple-Choice Question AnsweringHead-QA (test)28.79Accuracy10Question AnsweringHEAD-QA100AR (%)7Question AnsweringHEAD-QA (eval)0Pathwise Violations (PathV)3