ResearchTasksGeneral Language Modeling PerformanceFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast UpdatedAggregate AlpacaEval, TruthfulQA, GSM8K, DROP, AGI Eval, BBH, MMLUWarmup-Stable-Only (WSO)44.7Average Score16Mar 18, 2026
Aggregate AlpacaEval, TruthfulQA, GSM8K, DROP, AGI Eval, BBH, MMLUWarmup-Stable-Only (WSO)44.7Average Score16Mar 18, 2026