Code Generation on xCodeEval (sample 500)
0.831Accuracy (Easy)FUNCODER
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| FUNCODERModel=GPT-42024.05 | 0.831 | 0.58 | 0.264 | 0.034 | 0.486 | |
| CodeTModel=GPT-42024.05 | 0.764 | 0.518 | 0.218 | 0.034 | 0.44 | |
| ReflexionModel=GPT-42024.05 | 0.713 | 0.411 | 0.195 | 0.025 | 0.386 | |
| StandardModel=GPT-42024.05 | 0.685 | 0.393 | 0.195 | 0.017 | 0.374 | |
| FUNCODERModel=GPT-3.52024.05 | 0.624 | 0.295 | 0.116 | 0 | 0.314 | |
| CodeTModel=GPT-3.52024.05 | 0.506 | 0.161 | 0.08 | 0 | 0.232 | |
| StandardModel=GPT-3.52024.05 | 0.444 | 0.152 | 0.046 | 0 | 0.202 | |
| ReflexionModel=GPT-3.52024.05 | 0.444 | 0.17 | 0.057 | 0 | 0.206 | |
| FUNCODERModel=Llama3-8b2024.05 | 0.22 | 0.009 | 0 | 0 | 0.08 | |
| FUNCODERModel=StableCode-3b2024.05 | 0.135 | 0.045 | 0.011 | 0 | 0.062 | |
| CodeTModel=Llama3-8b2024.05 | 0.124 | 0 | 0 | 0 | 0.044 | |
| CodeTModel=StableCode-3b2024.05 | 0.112 | 0.018 | 0 | 0 | 0.046 | |
| FUNCODERModel=CodeLlama-34b2024.05 | 0.102 | 0 | 0 | 0 | 0.036 | |
| CodeTModel=CodeLlama-34b2024.05 | 0.101 | 0 | 0 | 0 | 0.036 | |
| StandardModel=Llama3-8b2024.05 | 0.09 | 0.018 | 0 | 0 | 0.036 | |
| StandardModel=StableCode-3b2024.05 | 0.073 | 0.009 | 0 | 0 | 0.028 | |
| StandardModel=CodeLlama-34b2024.05 | 0.023 | 0 | 0 | 0 | 0.008 |