ResearchDatasetsFairEvalFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsLLM Evaluation PerformanceFairEval0.638Accuracy14