NLP Benchmark Suite
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
NLP Benchmark Suite Zero-shot (HellaSwag, RACE, PIQA, WinoGrande, ARC, OBQA) (test)
63.36HellaSwag Accuracy
28
NLP Benchmark Suite Aggregate
-9.2Average Delta
16
NLP Benchmark Suite Average
64Average Accuracy
9