Loading the SOTA2 catalog…
Large Language Model Evaluation on GSM8K, TruthfulQA, CommonsenseQA, MMLU, ARC, and TriviaQA benchmark leaderboard · SOTA2 Research