NLP Evaluation Suite
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Zero-shot NLP Evaluation Suite (WikiText2, BoolQ, PIQA, HellaSwag, WinoGrande, ARC, OBQA, MTQA) (test)
7.43WikiText2 Perplexity
27
NLP Evaluation Suite (SciQ, PIQA, WG, ARC, HellaSwag, LogiQA, BoolQ, LAMBADA)
58.3SciQ Accuracy
14
NLP Evaluation Suite SST-2, RTE, CB, BoolQ, WSC, MultiRC, COPA, SQuAD, DROP (test)
95.41SST-2 Accuracy
6
NLP Evaluation Suite (WG, PIQA, BoolQ, ARC-C, ARC-E, OBQA, HS, SciQ, LM, RTE)
60.14WG
6