ResearchDatasetsshared human-rated question setFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsLLM-judge evaluation on humanities rubricshared human-rated question set n=100 (test)4.88Answer Accuracy16
LLM-judge evaluation on humanities rubricshared human-rated question set n=100 (test)4.88Answer Accuracy16