ResearchDatasetsAverage across tasksFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsAverage across tasksAverage across tasks57.2Performance @ 8k Context Length13Multi-task Reasoning AggregateAverage across tasks73Accuracy12Robotic ManipulationAverage across tasks37.9Success Rate8