NLP Benchmark
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
7-task NLP benchmark
1.18Avg Performance
20
NLP Benchmark (SNLI, MNLI, SICK, QNLI, RTE, SciTail) Llama-3-8B (val)
97.56SNLI Accuracy
12
8-domain NLP benchmark
11.8Vanilla Forgetting
5