ResearchTasksGeneral Large Language Model EvaluationFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast UpdatedCore Capabilities AggregateQwen3-4B72.32Average Score20Feb 26, 2026