Loading the SOTA2 catalog…
Large Language Model Evaluation on MMLU, GSM8K, GPQA, HumanEval, TruthfulQA, and IFEVAL benchmark leaderboard · SOTA2 Research