Conversational Function-Calling on τ-bench Retail (Public Leaderboard)
80.9ScoreASSAY (GPT-5.4)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ASSAY (GPT-5.4)Base Model=GPT-5.4, Framework=ASSAY2026.06 | 80.9 | — | |
| Claude family2026.06 | 80.5 | 1 | |
| GLM-4.52026.06 | 79.7 | 6 | |
| GLM-4.5-Air2026.06 | 77.9 | 7 | |
| Qwen3-Coder 480BParameters=480B2026.06 | 77.5 | 8 | |
| ASSAY (GPT-4.1)Base Model=GPT-4.1, Framework=ASSAY2026.06 | 73.9 | — | |
| ASSAY (Gemini 2.5)Base Model=Gemini 2.5, Framework=ASSAY2026.06 | 73.9 | — | |
| o4-mini2026.06 | 71.8 | 9 | |
| o12026.06 | 70.8 | 10 | |
| GPT-4.52026.06 | 68.4 | 13 | |
| GPT-4.1 (raw)Base Model=GPT-4.1, Variant=raw baseline2026.06 | 68 | 14 | |
| ASSAY (DS-V3)Base Model=DeepSeek-V3, Framework=ASSAY2026.06 | 66.1 | — | |
| ASSAY (GPT-4o)Base Model=GPT-4o, Framework=ASSAY2026.06 | 62.6 | — | |
| GPT-4o (raw)Base Model=GPT-4o, Variant=raw baseline2026.06 | 60.3 | — |