ResearchDatasetsSFT Evaluation SuiteFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsLarge Language Model EvaluationSFT Evaluation Suite (AlpacaEval, TruthfulQA, MMLU) (test)78.1AlpacaEval Score7
Large Language Model EvaluationSFT Evaluation Suite (AlpacaEval, TruthfulQA, MMLU) (test)78.1AlpacaEval Score7