ResearchBenchmarksCode Generation on HumanEval (Accuracy Deg %, BERTScore)Follow-0.37Accuracy Degradation (%)PromptCOS-0.48160.27171.0251.7783Sep 3, 2025Evaluation ResultsMethodMethodLinksAccuracy Degradation (%)BERTScorePromptCOSModel=CodeGemma-2bModel=CodeGemma-2b2025.09-0.370.73PC*Model=CodeGemma-7bModel=CodeGemma-7b2025.090.370.77PromptCOSModel=CodeGemma-7bModel=CodeGemma-7b2025.090.580.66PC*Model=CodeGemma-2bModel=CodeGemma-2b2025.091.360.74PCGModel=CodeGemma-7bModel=CodeGemma-7b2025.091.810.53PCGModel=CodeGemma-2bModel=CodeGemma-2b2025.092.420.56