ResearchDatasetsARC, HellaSwag, MMLU, TruthfulQA, WinoGrandeFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsFew-shot Language EvaluationARC, HellaSwag, MMLU, TruthfulQA, WinoGrande Few-shot Llama2-7B56.06ARC Accuracy6Language Modeling EvaluationARC, HellaSwag, MMLU, TruthfulQA, WinoGrande34.64ARC Accuracy4
Few-shot Language EvaluationARC, HellaSwag, MMLU, TruthfulQA, WinoGrande Few-shot Llama2-7B56.06ARC Accuracy6