ResearchBenchmarksLarge Language Model Downstream Evaluation on General Downstream SuiteFollow55.51MMLUNITP55.073255.186655.355.4134May 24, 2026Evaluation ResultsMethodMethodLinksMMLUM-Pro ScoreC-EvalXiezhi ScoreLAMBADABBHARC-CCSQACOPAC3 ScoreAGIEvalGSM8KLCBenchAverage ScoreNITPModel=45B MoE, Tokens=...Model=45B MoE, Tokens=240B2026.0555.5132.2950.8759.9769.3843.4870.159.9575.278.3638.6952.6215.8354.02NTPModel=45B MoE, Tokens=...Model=45B MoE, Tokens=240B2026.0555.0931.7147.6757.6569.0342.8967.759.4675.275.5135.0850.2713.3952.36