Multi-turn agent decision making on ToolSandbox (test)
52.2Success RateH-EPM
Evaluation Results
| Method | Links | |
|---|---|---|
| H-EPMBackbone=Qwen3-4B-Instruct-2507, Training Algorithm=H-EPM, Skip Probability (pskip)=0.82025.12 | 52.2 | |
| H-EPMBackbone=Qwen3-4B-Instruct-2507, Training Algorithm=H-EPM, Skip Probability (pskip)=1.02025.12 | 51 | |
| H-EPMBackbone=Qwen3-4B-Instruct-2507, Training Algorithm=H-EPM, Skip Probability (pskip)=0.92025.12 | 50.5 | |
| GRPOBackbone=Qwen3-4B-Instruct-2507, Training Algorithm=GRPO2025.12 | 50.3 | |
| AgentEvolverBackbone=Qwen3-4B-Instruct-2507, Training Algorithm=AE2025.12 | 49 | |
| BASEBackbone=Qwen3-4B-Instruct-2507, Training Algorithm=Base Model2025.12 | 47.8 | |
| SFTBackbone=Qwen3-4B-Instruct-2507, Training Algorithm=SFT2025.12 | 47.3 |