ResearchBenchmarksCode Generation on HumanEval-Pro Held-out after Compositional StreamFollow72.5AccuracyReAct60.33263.49166.6569.809Jun 1, 2026Evaluation ResultsMethodMethodLinksAccuracyPGReActcontext=Held-outcontext=Held-out2026.0672.5—MEMPROBEcontext=Held-outcontext=Held-out2026.0671.70.8LangMemcontext=Held-outcontext=Held-out2026.0670.81.7Mem0context=Held-outcontext=Held-out2026.0670.81.7AWMcontext=Held-outcontext=Held-out2026.06702.5ExpRAGcontext=Held-outcontext=Held-out2026.0668.34.2ReMemcontext=Held-outcontext=Held-out2026.0667.55DC-RScontext=Held-outcontext=Held-out2026.0660.811.7