ResearchDatasetsStandard LLM Evaluation SuiteFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsLanguage Modeling and Zero-shot ReasoningStandard LLM Evaluation Suite ARC-e, PIQA, Hellaswag, OpenBookQA, Winogrande, MMLU, BoolQ3.254PT Eval Loss5
Language Modeling and Zero-shot ReasoningStandard LLM Evaluation Suite ARC-e, PIQA, Hellaswag, OpenBookQA, Winogrande, MMLU, BoolQ3.254PT Eval Loss5