ResearchDatasetsGeneral LLM Task BenchmarkFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsGeneral Capability HarmlessnessGeneral LLM Task Benchmark62Average Accuracy12