Downstream NLP Suite
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Downstream NLP Suite MMLU, BoolQ, PIQA, WinoGrande, HellaSwag, ARC-e, ARC-c, OBQA
72.94Average Accuracy
35
Downstream NLP Suite 0-shot (ARC-C, ARC-E, HellaSwag, PIQA, SciQ, WinoGrande)
29.8ARC-C Accuracy
9