Commonsense and Reading Comprehension Suite
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
7-benchmark commonsense and reading-comprehension suite (ARC-Easy, ARC-Challenge, HellaSwag, WinoGrande, PIQA, BoolQ, and OpenBookQA) LM Evaluation Harness default (test)
68.77Accuracy
108
Commonsense and Reading Comprehension Suite (ARC-c, ARC-e, BoolQ, HellaSwag, LAMBADA, PIQA, RACE) zero-shot
26.37ARC-c Accuracy
8