ResearchDatasetsQuality benchmarkFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsGeneral LLM quality assessmentQuality benchmark 20 tasks (test)100Code Generation Accuracy3