ResearchTasksMultiple Choice EvaluationFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast UpdatedDownstream Tasks (ARC, HellaSwag, PIQA, Winogrande) Standard LLM Eval (val/test)L3 Transformer56.98Average Accuracy9Feb 26, 2026
Downstream Tasks (ARC, HellaSwag, PIQA, Winogrande) Standard LLM Eval (val/test)L3 Transformer56.98Average Accuracy9Feb 26, 2026