ResearchTasksZero-shot Language Understanding and ReasoningFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast UpdatedBENCH-PROXY (MMLU, ANLI, HellaSwag, PIQA, SIQA, W.G., ARC-E, ARC-C, C.QA, WSC) (test)Random34.32MMLU24Feb 26, 2026LLM Evaluation Suite (MMLU, ARC-C, PIQA, WinoG, GSM8K, HellaSwag, GPQA, RACE) zero-shot LLaDA1.5Base58.59Average Score13Feb 26, 2026LLM Evaluation Suite (HellaSwag, MMLU, ARC-C, BoolQ, Lambada, ARC-E, HumanEval) zero-shot Qwen3-30B-A3BFull79.8HellaSwag Accuracy12Apr 2, 2026nine-benchmark suite (MMLU, ARC, CSQA, HellaSwag, OpenBookQA, PIQA, SocialIQA, WinoGrande) (test val)FLUX31.7MMLU Accuracy6Mar 17, 2026
BENCH-PROXY (MMLU, ANLI, HellaSwag, PIQA, SIQA, W.G., ARC-E, ARC-C, C.QA, WSC) (test)Random34.32MMLU24Feb 26, 2026
LLM Evaluation Suite (MMLU, ARC-C, PIQA, WinoG, GSM8K, HellaSwag, GPQA, RACE) zero-shot LLaDA1.5Base58.59Average Score13Feb 26, 2026
LLM Evaluation Suite (HellaSwag, MMLU, ARC-C, BoolQ, Lambada, ARC-E, HumanEval) zero-shot Qwen3-30B-A3BFull79.8HellaSwag Accuracy12Apr 2, 2026
nine-benchmark suite (MMLU, ARC, CSQA, HellaSwag, OpenBookQA, PIQA, SocialIQA, WinoGrande) (test val)FLUX31.7MMLU Accuracy6Mar 17, 2026