ResearchTasksDownstream NLP EvaluationFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast UpdatedDownstream NLP Tasks (Lambada, ARC, WinoGrande, PIQA, HellaSwag, SciQ, RACE) LM Evaluation Harness (test)Pythia-12B70.4Lambada OpenAI36Feb 26, 2026
Downstream NLP Tasks (Lambada, ARC, WinoGrande, PIQA, HellaSwag, SciQ, RACE) LM Evaluation Harness (test)Pythia-12B70.4Lambada OpenAI36Feb 26, 2026