Commonsense Reasoning Benchmarks
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Commonsense Reasoning Benchmarks (BoolQ, PIQA, HellaSwag, WinoGrande, ARC-e, ARC-c, OBQA) zero-shot
70.185Avg Accuracy
63
Commonsense Reasoning Benchmarks zero-shot LLaMA-2-13B
80.92BoolQ Accuracy (Zero-shot)
17
Commonsense Reasoning Benchmarks Aggregate
71.9Score
12
Commonsense Reasoning Benchmarks (PIQA, ARC, HS, WG, BoolQ, MMLU) zero-shot
82.1PIQA Accuracy (Zero-shot)
10
Commonsense Reasoning Benchmarks (HellaSwag, WinoGrande, BoolQ)
73.6HellaSwag
5