ResearchTasksLong-context memory-based conversation reasoningFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast UpdatedBEAM 100K (test)SelfMem59Pass@0.5 Rate10Jul 7, 2026BEAM 1M (test)SelfMem52.57Pass@0.59Jul 7, 2026BEAM 500K (test)SelfMem57Pass@0.59Jul 7, 2026