Agent Task Completion on τ2-BENCH (test)
0.921Average Task RewardH-EPM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| H-EPMModel Backbone=GPT-5.12025.12 | 0.921 | — | |
| Base ModelModel Backbone=GPT-5.12025.12 | 0.842 | 0 | |
| H-EPMModel Backbone=GPT-4.1-MINI2025.12 | 0.526 | 32.8 | |
| H-EPMModel Backbone=GPT-4.12025.12 | 0.512 | 43 | |
| ToolNetModel Backbone=GPT-4.1-MINI2025.12 | 0.452 | 14.1 | |
| Reasoning BankModel Backbone=GPT-4.1-MINI2025.12 | 0.441 | 11.4 | |
| Retrieval Top-3Model Backbone=GPT-4.12025.12 | 0.439 | 22.6 | |
| ToolNetModel Backbone=GPT-4.12025.12 | 0.425 | 18.7 | |
| Retrieval Top-3Model Backbone=GPT-4.1-MINI2025.12 | 0.422 | 6.6 | |
| Reasoning BankModel Backbone=GPT-4.12025.12 | 0.413 | 15.4 | |
| Base ModelModel Backbone=GPT-4.1-MINI2025.12 | 0.396 | 0 | |
| H-EPMModel Backbone=GPT-4O2025.12 | 0.362 | 26.1 | |
| Base ModelModel Backbone=GPT-4.12025.12 | 0.358 | 0 | |
| ToolNetModel Backbone=GPT-4O2025.12 | 0.333 | 16 | |
| Reasoning BankModel Backbone=GPT-4O2025.12 | 0.309 | 7.7 | |
| H-EPMModel Backbone=QWEN3-8B2025.12 | 0.309 | 53.7 | |
| Retrieval Top-3Model Backbone=GPT-4O2025.12 | 0.298 | 3.8 | |
| Base ModelModel Backbone=GPT-4O2025.12 | 0.287 | 0 | |
| ToolNetModel Backbone=QWEN3-8B2025.12 | 0.256 | 27.4 | |
| Reasoning BankModel Backbone=QWEN3-8B2025.12 | 0.246 | 22.4 | |
| H-EPMModel Backbone=QWEN3-4B-INS2025.12 | 0.232 | 46.8 | |
| Base ModelModel Backbone=QWEN3-8B2025.12 | 0.201 | 0 | |
| ToolNetModel Backbone=QWEN3-4B-INS2025.12 | 0.193 | 22.2 | |
| Retrieval Top-3Model Backbone=QWEN3-8B2025.12 | 0.189 | -6 | |
| Reasoning BankModel Backbone=QWEN3-4B-INS2025.12 | 0.184 | 16.5 | |
| Retrieval Top-3Model Backbone=QWEN3-4B-INS2025.12 | 0.174 | 10.1 | |
| Base ModelModel Backbone=QWEN3-4B-INS2025.12 | 0.158 | 0 |