Tool Use on Berkeley Function Calling Leaderboard (BFCL) v3
78.9AccuracyClaude-Opus-4.5
Evaluation Results
| Method | Links | |
|---|---|---|
| Claude-Opus-4.52026.06 | 78.9 | |
| Gemini-3-Pro2026.06 | 78.2 | |
| Qwen3-235B-A22B-Instruct-25072026.06 | 71.2 | |
| Kimi-K2-Instruct-09052026.06 | 70.3 | |
| DeepSeek-V3.22026.06 | 68.8 | |
| Qwen3-Coder-480B-A35B-Instruct2026.06 | 68.7 | |
| GLM-4.72026.06 | 64.8 | |
| GPT-5.12026.06 | 64.4 | |
| Qwen2.5-Coder-32B-Instruct2026.06 | 62.3 | |
| Qwen2.5-Coder-14B-Instruct2026.06 | 59.9 | |
| Kimi-Dev-72B2026.06 | 55.5 | |
| Qwen2.5-Coder-7B-Instruct2026.06 | 54.2 | |
| LoopCoder-v2R (number of refinement loops)=22026.06 | 40.1 | |
| LoopCoder-v2R (number of refinement loops)=42026.06 | 39.5 | |
| LoopCoder-v2R (number of refinement loops)=32026.06 | 36.3 | |
| LoopCoder-v2R (number of refinement loops)=12026.06 | 32.2 |