ResearchDatasetsDownstream NLP TasksFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsDownstream NLP EvaluationDownstream NLP Tasks (Lambada, ARC, WinoGrande, PIQA, HellaSwag, SciQ, RACE) LM Evaluation Harness (test)70.4Lambada OpenAI36
Downstream NLP EvaluationDownstream NLP Tasks (Lambada, ARC, WinoGrande, PIQA, HellaSwag, SciQ, RACE) LM Evaluation Harness (test)70.4Lambada OpenAI36