Agent Task Completion on ToolSandbox (test)
0.704Avg Task RewardH-EPM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| H-EPMModel Backbone=GPT-4.12025.12 | 0.704 | 11.2 | |
| H-EPMModel Backbone=GPT-4O2025.12 | 0.673 | 8.7 | |
| H-EPMModel Backbone=GPT-5.12025.12 | 0.67 | — | |
| H-EPMModel Backbone=GPT-4.1-MINI2025.12 | 0.658 | 12.7 | |
| ToolNetModel Backbone=GPT-4O2025.12 | 0.652 | 5.3 | |
| Base ModelModel Backbone=GPT-5.12025.12 | 0.647 | 0 | |
| ToolNetModel Backbone=GPT-4.12025.12 | 0.643 | 1.6 | |
| Base ModelModel Backbone=GPT-4.12025.12 | 0.633 | 0 | |
| Reasoning BankModel Backbone=GPT-4O2025.12 | 0.632 | 2.1 | |
| Reasoning BankModel Backbone=GPT-4.1-MINI2025.12 | 0.628 | 7.5 | |
| ToolNetModel Backbone=GPT-4.1-MINI2025.12 | 0.624 | 6.8 | |
| Base ModelModel Backbone=GPT-4O2025.12 | 0.619 | 0 | |
| Reasoning BankModel Backbone=GPT-4.12025.12 | 0.605 | -4.4 | |
| Retrieval Top-3Model Backbone=GPT-4O2025.12 | 0.598 | -3.4 | |
| Base ModelModel Backbone=GPT-4.1-MINI2025.12 | 0.584 | 0 | |
| Retrieval Top-3Model Backbone=GPT-4.1-MINI2025.12 | 0.582 | -0.3 | |
| H-EPMModel Backbone=QWEN3-4B-INS2025.12 | 0.565 | 18.2 | |
| ToolNetModel Backbone=QWEN3-4B-INS2025.12 | 0.549 | 14.9 | |
| Retrieval Top-3Model Backbone=QWEN3-4B-INS2025.12 | 0.542 | 13.4 | |
| Reasoning BankModel Backbone=QWEN3-4B-INS2025.12 | 0.532 | 11.3 | |
| Retrieval Top-3Model Backbone=GPT-4.12025.12 | 0.526 | -16.9 | |
| H-EPMModel Backbone=QWEN3-8B2025.12 | 0.514 | 5.1 | |
| ToolNetModel Backbone=QWEN3-8B2025.12 | 0.498 | 1.8 | |
| Base ModelModel Backbone=QWEN3-8B2025.12 | 0.489 | 0 | |
| Retrieval Top-3Model Backbone=QWEN3-8B2025.12 | 0.482 | -1.4 | |
| Base ModelModel Backbone=QWEN3-4B-INS2025.12 | 0.478 | 0 | |
| Reasoning BankModel Backbone=QWEN3-8B2025.12 | 0.476 | -2.7 |