Code Generation on HumanEval (Performance %)
71.9Performance (%)ATOM
Evaluation Results
| Method | Links | |
|---|---|---|
| ATOMBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 71.9 | |
| LLM-DebateBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 71.07 | |
| CompleteBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 70.25 | |
| RandomBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 69.42 | |
| StarBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 68.6 | |
| ARG-DesignerBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 68.6 | |
| CoTBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 67.77 | |
| ChainBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 66.12 | |
| G-DesignerBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 66.12 | |
| VanillaBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 65.29 | |
| AgentPruneBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 62.81 | |
| AgentDropoutBackbone Model=Meta-Llama-3.1-8B-Instruct2026.05 | 62.81 |