ResearchDatasetsAligned human-evaluation chunksFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsMachine Translation EvaluationAligned 300-word human-evaluation chunks8.657HT Mean Score4