Agent Task Completion on τ-BENCH (test)
0.791Average Task RewardH-EPM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| H-EPMModel Backbone=GPT-5.12025.12 | 0.791 | — | |
| Base ModelModel Backbone=GPT-5.12025.12 | 0.739 | 0 | |
| H-EPMModel Backbone=GPT-4.12025.12 | 0.71 | 7.9 | |
| Retrieval Top-3Model Backbone=GPT-4.12025.12 | 0.672 | 2.1 | |
| H-EPMModel Backbone=GPT-4O2025.12 | 0.67 | 10 | |
| H-EPMModel Backbone=GPT-4.1-MINI2025.12 | 0.661 | 22.2 | |
| Base ModelModel Backbone=GPT-4.12025.12 | 0.658 | 0 | |
| ToolNetModel Backbone=GPT-4.12025.12 | 0.652 | -0.9 | |
| Reasoning BankModel Backbone=GPT-4.12025.12 | 0.645 | -2 | |
| Retrieval Top-3Model Backbone=GPT-4O2025.12 | 0.644 | 5.7 | |
| ToolNetModel Backbone=GPT-4O2025.12 | 0.634 | 4.1 | |
| Reasoning BankModel Backbone=GPT-4O2025.12 | 0.624 | 2.5 | |
| Base ModelModel Backbone=GPT-4O2025.12 | 0.609 | 0 | |
| Retrieval Top-3Model Backbone=GPT-4.1-MINI2025.12 | 0.575 | 6.3 | |
| ToolNetModel Backbone=GPT-4.1-MINI2025.12 | 0.572 | 5.7 | |
| Reasoning BankModel Backbone=GPT-4.1-MINI2025.12 | 0.567 | 4.8 | |
| Base ModelModel Backbone=GPT-4.1-MINI2025.12 | 0.541 | 0 | |
| H-EPMModel Backbone=QWEN3-4B-INS2025.12 | 0.496 | 14 | |
| ToolNetModel Backbone=QWEN3-4B-INS2025.12 | 0.458 | 5.3 | |
| Reasoning BankModel Backbone=QWEN3-4B-INS2025.12 | 0.451 | 3.7 | |
| Retrieval Top-3Model Backbone=QWEN3-4B-INS2025.12 | 0.451 | 3.7 | |
| Base ModelModel Backbone=QWEN3-4B-INS2025.12 | 0.435 | 0 | |
| H-EPMModel Backbone=QWEN3-8B2025.12 | 0.421 | 9.9 | |
| ToolNetModel Backbone=QWEN3-8B2025.12 | 0.398 | 3.9 | |
| Base ModelModel Backbone=QWEN3-8B2025.12 | 0.383 | 0 | |
| Reasoning BankModel Backbone=QWEN3-8B2025.12 | 0.376 | -1.8 | |
| Retrieval Top-3Model Backbone=QWEN3-8B2025.12 | 0.344 | -10.2 |