Function Calling on BFCL (Live)
88.25Simple AccuracyGENESISFUNC-8B
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| GENESISFUNC-8Bbase_model=Qwen3-8B2026.04 | 88.25 | 80.5 | — | — | 81.5 | 84.88 | 83.78 | |
| DeepSeek-V32026.04 | 86.05 | 78.82 | — | — | 75 | 66.67 | 79.94 | |
| Gemini-2.5-Pro2026.04 | 85.66 | 74.36 | — | — | 87.5 | 83.33 | 76.83 | |
| Qwen3-32B2026.04 | 84.5 | 80.44 | — | — | 93.75 | 66.67 | 81.13 | |
| LLaMA-3.1-70B-Instruct2026.04 | 83.33 | 75.59 | — | — | 87.5 | 58.33 | 76.91 | |
| Automated Prompt Optimization (4o-r2-5-mini-v3-gepa)Configuration=4o-r2-5-mini-v3-gepa, Prompt Version=v3-gepa2026.04 | 83.1 | 77.4 | 83.6 | 78.5 | — | — | — | |
| ToolACE-8B2026.04 | 82.95 | 79.58 | — | — | 75.25 | 85.12 | 80.73 | |
| o3-mini Reviewer (4o-r-o3-mini)Configuration=4o-r-o3-mini, Reviewer=o3-mini2026.04 | 82.2 | 79 | 80.8 | 79.6 | — | — | — | |
| Best-of-N Selection (4o-s5-4o-v2-bfcl)Configuration=4o-s5-4o-v2-bfcl, Mechanism=Selector, Prompt Version=v2-bfcl2026.04 | 81.8 | 79.2 | 78.8 | 79.8 | — | — | — | |
| Qwen-ToolRL-8B2026.04 | 81.48 | 77.82 | — | — | 72.75 | 81.5 | 78.39 | |
| Best-of-N Grading (4o-g5-4o-v1)Configuration=4o-g5-4o-v1, Mechanism=Grader, Prompt Version=v12026.04 | 81.4 | 78.7 | 79.5 | 79.5 | — | — | — | |
| Best-of-N Selection (4o-s5-4o-v1)Configuration=4o-s5-4o-v1, Mechanism=Selector, Prompt Version=v12026.04 | 81 | 79.1 | 79.5 | 79.6 | — | — | — | |
| Automated Prompt Optimization (4o-r2-5-mini-v2-bfcl)Configuration=4o-r2-5-mini-v2-bfcl, Prompt Version=v2-bfcl2026.04 | 80.9 | 78.4 | 80.8 | 78.9 | — | — | — | |
| Automated Prompt Optimization (4o-r2-5-mini-v1-1)Configuration=4o-r2-5-mini-v1-1, Prompt Version=v1-12026.04 | 80.6 | 77.6 | 83.2 | 78.1 | — | — | — | |
| Progressive Feedback (4o-r5-4o-v2-bfcl)Configuration=4o-r5-4o-v2-bfcl, Feedback Model=GPT-4o, Prompt Version=v2-bfcl2026.04 | 80.6 | 78.8 | 76.4 | 79.3 | — | — | — | |
| Qwen3-8B2026.04 | 80.23 | 77.21 | — | — | 81.25 | 75 | 77.79 | |
| 4o (baseline)Configuration=4o (baseline)2026.04 | 79.8 | 78.9 | 77.6 | 79.2 | — | — | — | |
| Best-of-N Grading (4o-g5-4o-v2-bfcl)Configuration=4o-g5-4o-v2-bfcl, Mechanism=Grader, Prompt Version=v2-bfcl2026.04 | 79.8 | 78.9 | 78.7 | 79.2 | — | — | — | |
| GPT-4o-mini2026.04 | 79.46 | 76.26 | — | — | 87.5 | 70.83 | 76.91 | |
| Progressive Feedback (4o-r5-4o-v1)Configuration=4o-r5-4o-v1, Feedback Model=GPT-4o, Prompt Version=v12026.04 | 78.7 | 76.8 | 82.2 | 77.5 | — | — | — | |
| Hammer2.1-7B2026.04 | 77.13 | 77.59 | — | — | 87.5 | 70.83 | 77.5 | |
| xLAM-8B2026.04 | 75.58 | 66.57 | — | — | 56.25 | 54.17 | 67.95 | |
| LLaMA-3.1-8B-Instruct2026.04 | 72.87 | 71.13 | — | — | 50 | 45.83 | 59.96 | |
| GPT-4o2026.04 | 70.54 | 70.75 | — | — | 62.5 | 66.67 | 70.54 |