Downstream Tasks
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Downstream Tasks MMLU, HellaSwag, PIQA, BoolQ, WinoGrande, ARC-E, ARC-C, OBQA (500 samples per task)
74.4MMLU
7
15 Downstream Tasks summary
2Median EG
7
Average of 8 downstream tasks
10.63FID
7
Downstream Tasks (KOLD, HateXplain, etc.)
0.316Average Correlation
6
9 downstream tasks
62.6Average Accuracy
6
Downstream Tasks zero-shot (Arc-c, Arc-e, BoolQ, COPA, MMLU, OBQA, PIQA, RTE, Winogrande)
49.32Arc-c
6
Downstream Tasks (test)
62.35Accuracy
6
Downstream Tasks (test)
62.53Accuracy
6
Downstream Tasks BoolQ, MMLU, WinoG
71.9BoolQ Accuracy
5
Zero-shot Downstream Tasks (Arc-e, PIQA, Hellaswag, OpenBookQA, Winogrande, MMLU, BoolQ) Llama-1B Benchmark Suite (test)
31.63Arc-e Accuracy
5