Tool Calling on BFCL (Berkeley Function Calling Leaderboard)
85.3BFCL ScoreQwen3-14B
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Qwen3-14BBase Model=Qwen3-14B, Training Strategy=Base2026.06 | 85.3 | — | — | — | — | — | |
| Qwen3-8BBase Model=Qwen3-8B, Training Strategy=Base2026.06 | 83.7 | — | — | — | — | — | |
| RUBASBase Model=Qwen3-14B, Training Strategy=+ RUBAS2026.06 | 82.5 | — | — | — | — | — | |
| GuardModelBase Model=Qwen3-14B, Training Strategy=+ GuardModel2026.06 | 82.3 | — | — | — | — | — | |
| RuleBase Model=Qwen3-14B, Training Strategy=+ Rule2026.06 | 81.2 | — | — | — | — | — | |
| RuleBase Model=Qwen3-8B, Training Strategy=+ Rule2026.06 | 80.8 | — | — | — | — | — | |
| RUBASBase Model=Qwen3-8B, Training Strategy=+ RUBAS2026.06 | 79.5 | — | — | — | — | — | |
| GuardModelBase Model=Qwen3-8B, Training Strategy=+ GuardModel2026.06 | 79.2 | — | — | — | — | — | |
| RUBASBase Model=GLM-4.7-Flash, Training Strategy=+ RUBAS2026.06 | 71 | — | — | — | — | — | |
| GLM-4.7-FlashBase Model=GLM-4.7-Flash, Training Strategy=Base2026.06 | 68.4 | — | — | — | — | — | |
| SFTBase Model=GLM-4.7-Flash, Training Strategy=+ SFT2026.06 | 65 | — | — | — | — | — | |
| DPOBase Model=Qwen3-8B, Training Strategy=+ DPO2026.06 | 60.7 | — | — | — | — | — | |
| SFTBase Model=Qwen3-8B, Training Strategy=+ SFT2026.06 | 57.6 | — | — | — | — | — | |
| SFTBase Model=Qwen3-14B, Training Strategy=+ SFT2026.06 | 57 | — | — | — | — | — | |
| DPOBase Model=Qwen3-14B, Training Strategy=+ DPO, Training Status=Failure (†)2026.06 | 0.2 | — | — | — | — | — | |
| RuleBase Model=GLM-4.7-Flash, Training Strategy=+ Rule, Training Status=Failure (†)2026.06 | 0 | — | — | — | — | — | |
| GuardModelBase Model=GLM-4.7-Flash, Training Strategy=+ GuardModel, Training Status=Failure (†)2026.06 | 0 | — | — | — | — | — | |
| DPOBase Model=GLM-4.7-Flash, Training Strategy=+ DPO, Training Status=Failure (†)2026.06 | 0 | — | — | — | — | — | |
| deepseek-moe-16b-chatEvaluation Mode=Prompt mode2026.05 | — | 10.2 | 4.6 | 0 | 75.2 | 22.5 | |
| EngGPT2-16B-A3BEvaluation Mode=Native Function Calling2026.05 | — | 73.8 | 65.3 | 1 | 56.1 | 49.1 | |
| FastwebMIIA-7BEvaluation Mode=Prompt mode2026.05 | — | 8.7 | 13.2 | 0 | 76 | 24.5 | |
| gemma-3-12b-itEvaluation Mode=Prompt mode2026.05 | — | 81.8 | 74.5 | 6.1 | 70.4 | 58.2 | |
| gemma-3-4b-itEvaluation Mode=Prompt mode2026.05 | — | 64.3 | 60.4 | 0.5 | 47.6 | 43.2 | |
| GPT-5 nanoEvaluation Mode=Native Function Calling2026.05 | — | 65.4 | 66.8 | 37 | 88.5 | 64.4 | |
| GPT-5 nanoEvaluation Mode=Prompt mode2026.05 | — | 76.7 | 63.6 | 0.8 | 45.4 | 46.6 | |
| gpt-oss-20bEvaluation Mode=Native Function Calling2026.05 | — | 33.8 | 73.6 | 26.5 | 84.5 | 54.6 | |
| Llama-3.1-8B-InstructEvaluation Mode=Prompt mode2026.05 | — | 85.2 | 70.4 | 7.4 | 54 | 54.2 | |
| Llama-3.2-3B-InstructEvaluation Mode=Prompt mode2026.05 | — | 84.5 | 63.1 | 0.4 | 33 | 45.3 | |
| LLaMAntino-3-ANITA-8BEvaluation Mode=Prompt mode2026.05 | — | 39.6 | 35.5 | 0.1 | 78.1 | 38.3 | |
| Minerva-7B-instruct-v1.0Evaluation Mode=Prompt mode2026.05 | — | 0 | 0 | 0 | 99.9 | 25 | |
| Ministral-3-8BEvaluation Mode=Native Function Calling2026.05 | — | 79.1 | 73.7 | 15 | 80.1 | 62 | |
| Moonlight-16B-A3B-InstructEvaluation Mode=Prompt mode2026.05 | — | 2.2 | 5.6 | 0 | 97.5 | 26.3 | |
| Qwen3-4BEvaluation Mode=Native Function Calling2026.05 | — | 83.2 | 81.8 | 29.8 | 79.1 | 68.5 | |
| Qwen3-8BEvaluation Mode=Native Function Calling2026.05 | — | 84.2 | 81.1 | 30.8 | 77.8 | 68.5 | |
| Velvet-14BEvaluation Mode=Prompt mode2026.05 | — | 5.8 | 2.8 | 0 | 94.1 | 25.7 |