ResearchDatasetsLLM TasksFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsLarge Language Model Reasoning3 LLM Tasks (CMMLU, GSM8K, HumanEval) (test)40.4Average Accuracy7Large Language Modeling3 LLM Tasks Aggregate LLaMa2 (average)0.405Accuracy6Language Modeling EvaluationEight benchmark LLM tasks49,781.23Throughput (Tokens/s)5