HuggingFace Open LLM Leaderboard
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
HuggingFace Open LLM Leaderboard
55.37GSM8K
49
HuggingFace Open LLM Leaderboard lm-eval-harness default (various)
84.34HellaSwag
36
Huggingface Open LLM Leaderboard
85.32HellaSwag Accuracy
30
HuggingFace Open LLM Leaderboard Old (test)
92.08GSM8K Score
14
HuggingFace Open LLM Leaderboard New
68.84BBH
7