ResearchBenchmarksOutcome Reasoning on HumanEval ExeFollow75.7M' (F1 Mean)GPT-546.5854.1461.769.26May 17, 2025Evaluation ResultsMethodMethodLinksM' (F1 Mean)Y' (F1 Mean)GPT-5Model=GPT-5Model=GPT-52025.0575.771.5GPT-o4Model=GPT-o4Model=GPT-o42025.0573.466.5Llama4-MModel=Llama4-MModel=Llama4-M2025.0563.656.9DeepSeekModel=DeepSeekModel=DeepSeek2025.0559.452.7Qwen3Model=Qwen3Model=Qwen32025.0558.251.5Gemini2.5Model=Gemini2.5Model=Gemini2.52025.0555.849.4Llama4-SModel=Llama4-SModel=Llama4-S2025.0547.741.2