ResearchTasksZero-shot Reasoning and Language ModelingFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast UpdatedLLM Foundational Capabilities (SciQ, PIQA, Winogrande, ARC, HellaSwag, LogiQA, BoolQ, LAMBADA) zero-shotLLaMA2-7B94.1SciQ Accuracy17Feb 26, 2026LLaMA-3-8B Evaluation Suite ARC-C, HellaSwag, WinoGrande, PIQA, ARC-E, BoolQ, GSM8K, WikiText-2 (test)FP1653.4ARC-C Accuracy13Jul 2, 2026Qwen1.5-MoE-A2.7B evaluation suite zero-shotbf16 baseline6.79PPL11Jun 25, 2026
LLM Foundational Capabilities (SciQ, PIQA, Winogrande, ARC, HellaSwag, LogiQA, BoolQ, LAMBADA) zero-shotLLaMA2-7B94.1SciQ Accuracy17Feb 26, 2026
LLaMA-3-8B Evaluation Suite ARC-C, HellaSwag, WinoGrande, PIQA, ARC-E, BoolQ, GSM8K, WikiText-2 (test)FP1653.4ARC-C Accuracy13Jul 2, 2026