Commonsense Reasoning Tasks
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Six commonsense reasoning tasks zero-shot
77.51Average Accuracy (Zero-shot)
99
Commonsense Reasoning Tasks (ARC-e, OBQA, SIQA, ARC-c, WinoG, PIQA, BoolQ, HellaS) LLaMA3-8B
92.9ARC-e Accuracy
13