GPT-3 Evaluation Suite
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
GPT-3 Evaluation Suite (11 tasks: HellaSwag, LAMBADA, TriviaQA, WebQs, Winogrande, PIQA, ARC Challenge, ARC Easy, ANLI R1, ANLI R2, ANLI R3) zero-shot
33.6Average Accuracy
4
GPT-3 Evaluation Suite Few-shot
48.1Accuracy
3
GPT-3 Evaluation Suite (LAMBADA, TriviaQA, WebQs, PIQA, RACE-h, BoolQ) 1.3B various (test val)
44.4Overall Accuracy
3