ResearchDatasetsPooled tasksFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsLanguage Model EvaluationPooled tasks Table 5 Llama-3.1 3.3 (various)57.15Pooled Accuracy Estimate (γ̂)21
Language Model EvaluationPooled tasks Table 5 Llama-3.1 3.3 (various)57.15Pooled Accuracy Estimate (γ̂)21