Loading the SOTA2 catalog…
Large Language Model Evaluation on HuggingFace Open LLM Leaderboard (lm-eval-harness default) benchmark leaderboard · SOTA2 Research