ResearchDatasetsGeneral LLM Evaluation SuiteFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsGeneral Language Understanding and ReasoningGeneral LLM Evaluation Suite ARC-C ARC-E BoolQ HellaSwag MMLU OBQA RTE WinoGrande62.5ARC-Challenge Accuracy5
General Language Understanding and ReasoningGeneral LLM Evaluation Suite ARC-C ARC-E BoolQ HellaSwag MMLU OBQA RTE WinoGrande62.5ARC-Challenge Accuracy5