Tool Use on Unified evaluation benchmark D Multi-Hop (test)
83.3SPClaude 4.6 Sonnet
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Claude 4.6 SonnetSetting=Hybrid-20 Setting2026.04 | 83.3 | 89.6 | 74.1 | 84.1 | |
| UniToolCallSetting=Hybrid-20 Setting2026.04 | 80.7 | 89.6 | 66.6 | 78.8 | |
| Gemini 3 Flash PreviewSetting=Hybrid-20 Setting2026.04 | 77.2 | 83.6 | 69.3 | 78.5 | |
| Kimi-K2-InstructSetting=Hybrid-20 Setting2026.04 | 75.9 | 86.1 | 69.6 | 80.1 | |
| Qwen3-32BSetting=Hybrid-20 Setting2026.04 | 64 | 79.9 | 61.3 | 72.9 | |
| Qwen3-8B (Upper Bound)Setting=GT Setting2026.04 | 47.5 | 76.4 | 57.2 | 70 | |
| DeepSeek-V3.2Setting=Hybrid-20 Setting2026.04 | 39.7 | 65.3 | 54.3 | 60.9 | |
| GPT-5.2 InstantSetting=Hybrid-20 Setting2026.04 | 39 | 58.2 | 49.1 | 55.3 | |
| Qwen3-8B (Vanilla)Setting=Hybrid-20 Setting2026.04 | 22.7 | 53.9 | 38.1 | 38.1 |