Multi-turn agent decision making on tau2-Bench (test)
22.3Success RateH-EPM
Evaluation Results
| Method | Links | |
|---|---|---|
| H-EPMBackbone=Qwen3-4B-Instruct-2507, Training Algorithm=H-EPM, Skip Probability (pskip)=1.02025.12 | 22.3 | |
| H-EPMBackbone=Qwen3-4B-Instruct-2507, Training Algorithm=H-EPM, Skip Probability (pskip)=0.82025.12 | 21.8 | |
| H-EPMBackbone=Qwen3-4B-Instruct-2507, Training Algorithm=H-EPM, Skip Probability (pskip)=0.92025.12 | 21.3 | |
| GRPOBackbone=Qwen3-4B-Instruct-2507, Training Algorithm=GRPO2025.12 | 17.8 | |
| AgentEvolverBackbone=Qwen3-4B-Instruct-2507, Training Algorithm=AE2025.12 | 16.7 | |
| SFTBackbone=Qwen3-4B-Instruct-2507, Training Algorithm=SFT2025.12 | 16.3 | |
| BASEBackbone=Qwen3-4B-Instruct-2507, Training Algorithm=Base Model2025.12 | 15.8 |