Reasoning datasets (OpenbookQA, ARC_e, WinoGrande, HellaSwag, ARC_c, PIQA, MathQA)
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
7 reasoning datasets (OpenbookQA, ARC_e, WinoGrande, HellaSwag, ARC_c, PIQA, MathQA) (test)
60Overall Average Accuracy
28