Scenario-level policy synthesis on AppWorld challenge (test)
98.3TGCHCL-GP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| HCL-GPModel=Claude Sonnet 4.62026.05 | 98.3 | 97.8 | |
| GPModel=Claude Sonnet 4.6, Note=our baseline2026.05 | 83.2 | 82 | |
| Alibaba AgentRLModel=Qwen3-14B2026.05 | 67.6 | 50.4 | |
| IBM CUGAModel=GPT-4.12026.05 | 57.6 | 48.2 | |
| LOOPModel=Qwen2.5-32B2026.05 | 47.2 | 28.8 | |
| HCL-GPModel=GPT-OSS 120B2026.05 | 41 | 41 | |
| GPModel=GPT-OSS 120B, Note=our baseline2026.05 | 0.7 | 0.7 |