Commonsense Reasoning and Short-Context Language Understanding Suite
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Commonsense Reasoning and Short-Context Language Understanding Suite (PIQA, HellaSwag, WinoGrande, ARC-Easy, ARC-Challenge, SIQA, BoolQ, LAMBADA) zero-shot
73.3PIQA Accuracy (Zero-shot)
2