LLM Evaluation Suite
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
LLM Evaluation Suite
83.2Accuracy
53
LLM Evaluation Suite MMLU, GSM8k, HellaSwag, WinoGrande
64.43MMLU Score
31
LLM Evaluation Suite GQA, MMB, MME, POPE, SQA, VQAv2, VQA^Text, VizWiz
69.2GQA Score
20
LLM Evaluation Suite ARC-e, ARC-c, HellaSwag, OBQA, WinoGrande, MathQA, PIQA
64.01Average Accuracy
19
LLM Evaluation Suite (ARC, CSQA, GSM8K, HS, MMLU, OBQA, PIQA, SIQA, TQA, WG)
45.9ARC
14
LLM Evaluation Suite (MMLU, IFEval, GSM8K, MATH, HumanEval, MBPP, Hellaswag, GPQA)
51.94MMLU
13
LLM Evaluation Suite (MMLU, ARC-C, PIQA, WinoG, GSM8K, HellaSwag, GPQA, RACE) zero-shot LLaDA1.5
58.59Average Score
13
LLM Evaluation Suite (HellaSwag, MMLU, ARC-C, BoolQ, Lambada, ARC-E, HumanEval) zero-shot Qwen3-30B-A3B
79.8HellaSwag Accuracy
12
LLM Evaluation Suite
0.401Normalized Score
12
LLM Evaluation Suite MMLU, GSM8k, HellaSwag, WinoGrande
72.8MMLU
12
LLM Evaluation Suite ARC, BBH, HellaSwag, TruthfulQA, LAMBADA, WinoGrande, GSM8K, MT-Bench
54.61ARC (Accuracy)
3
LLM Evaluation Suite (AE, AC, SciQ, MM, MM-P, HS, OBQA, PIQA, RACE, WG, CSQA, AGI) zero-shot
67.97AE Score
2