LM Eval
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
LM-EVAL (Average of HellaSwag, PIQA, ARC-Easy, ARC-Challenge, and WinoGrande) zero-shot latest
76Average Accuracy
30
LM Eval ARCC, ARCE, HellaSwag, PIQA 0.4.4 standard (test)
61.6ARCC
18
lm-eval ARC-C, BoolQ, Lambada, PIQA, Winogrande
53.58ARC-C Accuracy
8