LM Downstream Evaluation Suite
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
LM Downstream Evaluation Suite (ARC-Easy, ARC-Challenge, BoolQ, CommonsenseQA, HellaSwag, OpenBookQA, PIQA, WinoGrande, MMLU) lm-eval-harness (test)
36.81ARC-Easy Accuracy
12