Function Calling on Berkeley Function Calling Benchmark v4
57.8Overall ScoreGPT-OSS-120b
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| GPT-OSS-120bReasoning effort=Med.2025.12 | 57.8 | 74.1 | 73.7 | 53.3 | 53.5 | 39.4 | — | |
| GPT-OSS-120bReasoning effort=High2025.12 | 55.3 | 57.4 | 72.7 | 51 | 45.5 | 47.3 | — | |
| K2Reasoning effort=Med.2025.12 | 52.4 | 72.9 | 78.5 | 50.6 | 39.5 | 30.8 | — | |
| GPT-OSS-120bReasoning effort=Low2025.12 | 48.8 | 74.7 | 75.3 | 35 | 42.5 | 32.7 | — | |
| QwenModel size/scale=3-32B2025.12 | 48.5 | 87.9 | 81.9 | 51.1 | 19.5 | 23 | — | |
| K2Reasoning effort=High2025.12 | 48 | 84.1 | 76.2 | 41.3 | 30 | 26 | — | |
| QwenModel size/scale=2.5-72B2025.12 | 45.9 | 87.2 | 77.9 | 33.9 | 32.5 | 25.6 | — | |
| K2Reasoning effort=Low2025.12 | 36.8 | 78.1 | 77.1 | 17.4 | 25 | 14.4 | — | |
| LlamaModel size/scale=3.3-70B2025.12 | 31.1 | 87.2 | 76.9 | 19.6 | 10 | 7.1 | — |