Multi-turn Agent Decision Making on tau-Bench (test)
55.8Success RateH-EPM
Evaluation Results
| Method | Links | |
|---|---|---|
| H-EPMBackbone=Qwen3-4B-Instruct-2507, Training Algorithm=H-EPM, Skip Probability (pskip)=0.92025.12 | 55.8 | |
| H-EPMBackbone=Qwen3-4B-Instruct-2507, Training Algorithm=H-EPM, Skip Probability (pskip)=1.02025.12 | 54.4 | |
| H-EPMBackbone=Qwen3-4B-Instruct-2507, Training Algorithm=H-EPM, Skip Probability (pskip)=0.82025.12 | 53.4 | |
| AgentEvolverBackbone=Qwen3-4B-Instruct-2507, Training Algorithm=AE2025.12 | 52 | |
| GRPOBackbone=Qwen3-4B-Instruct-2507, Training Algorithm=GRPO2025.12 | 51 | |
| BASEBackbone=Qwen3-4B-Instruct-2507, Training Algorithm=Base Model2025.12 | 43.5 | |
| SFTBackbone=Qwen3-4B-Instruct-2507, Training Algorithm=SFT2025.12 | 37.3 |