7-Task Evaluation Suite
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
7-Task Evaluation Suite (test)
75.7Average Accuracy
10
7-Task Evaluation Suite (HellaSwag, MathQA, MMLU, OpenBookQA, WinoGrande, GSM8K, HumanEval)
61.91Average Accuracy
8