ResearchBenchmarksCode Generation on HumanEval (Accuracy, Perplexity)Follow60.4AccuracyMAGS55.92857.08958.2559.411May 20, 2026Evaluation ResultsMethodMethodLinksAccuracyPerplexityMAGSBase Model=Llama-3.1-8...Base Model=Llama-3.1-8B-Instruct2026.0560.41.13ASBase Model=Llama-3.1-8...Base Model=Llama-3.1-8B-Instruct2026.0559.11.131CDBase Model=Llama-3.1-8...Base Model=Llama-3.1-8B-Instruct2026.0559.11.152ITIBase Model=Llama-3.1-8...Base Model=Llama-3.1-8B-Instruct2026.0557.31.136UnsteeredBase Model=Llama-3.1-8...Base Model=Llama-3.1-8B-Instruct2026.0556.11.121