ResearchDatasetsHuman EvalFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsCode GenerationHuman Eval zero-shot55.5Flexibility21Diagnostic report generationHuman-Eval 12-language (120 items)7.41Human Mean Score3