ResearchBenchmarksCode Generation on HumanEval MultiPL-E translation Rust (test)Follow0.68Pass@1Reflexion0.59680.61840.640.6616Mar 20, 2023Evaluation ResultsMethodMethodLinksPass@1ReflexionModel=GPT-4, Strategy=...Model=GPT-4, Strategy=Reflexion, Zero-shot=true2023.030.68GPT-4Model=GPT-4, Strategy=...Model=GPT-4, Strategy=Zero-shot, Zero-shot=true2023.030.6