Multi-turn tool-use interaction on tau-bench
86.1Retail Success RateU-Fold
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| U-FoldModel=Claude-4.5-Sonnet2026.01 | 86.1 | 54 | — | |
| ReActModel=Claude-4.5-Sonnet2026.01 | 85.2 | 56 | 2.8 | |
| IterResearchModel=Claude-4.5-Sonnet2026.01 | 76.5 | 52 | 9.5 | |
| U-FoldModel=DeepSeek-V3.2-Exp2026.01 | 74.8 | 54 | — | |
| U-FoldModel=GPT-4.12026.01 | 73 | 61.5 | — | |
| ReActModel=GPT-4.12026.01 | 72.2 | 60 | 2.5 | |
| ReActModel=DeepSeek-V3.2-Exp2026.01 | 70 | 46 | 3.4 | |
| ReSumModel=Claude-4.5-Sonnet2026.01 | 69.6 | 54 | 7.3 | |
| ReActModel=Qwen3-Thinking-30B-A3B2026.01 | 67 | 46 | 1.5 | |
| U-FoldModel=Qwen3-Thinking-30B-A3B2026.01 | 65.2 | 44 | — | |
| IterResearchModel=GPT-4.12026.01 | 65.2 | 50 | 13.9 | |
| NLACParadigm=Fine-tuning, Base Model=QwQ-32B2025.12 | 56 | 43 | — | |
| ReSumModel=DeepSeek-V3.2-Exp2026.01 | 55.7 | 46 | 15.8 | |
| ReSumModel=Qwen3-Thinking-30B-A3B2026.01 | 53.9 | 40 | 6.2 | |
| PPOParadigm=Fine-tuning, Base Model=QwQ-32B2025.12 | 52 | 41 | — | |
| NLQLParadigm=Fine-tuning, Base Model=QwQ-32B, Notes=ablation2025.12 | 51 | 36 | — | |
| GRPOParadigm=Fine-tuning, Base Model=QwQ-32B2025.12 | 49 | 39 | — | |
| ReSumModel=GPT-4.12026.01 | 46.1 | 46 | 12.7 | |
| ReActParadigm=Prompting, Base Model=GPT52025.12 | 44 | 32 | — | |
| NLRLParadigm=Fine-tuning, Base Model=QwQ-32B2025.12 | 44 | 31 | — | |
| IterResearchModel=Qwen3-Thinking-30B-A3B2026.01 | 43.5 | 42 | 11.3 | |
| NLACParadigm=Fine-tuning, Base Model=Qwen2.5-7B-Instruct2025.12 | 42 | 22 | — | |
| RFTParadigm=Fine-tuning, Base Model=QwQ-32B2025.12 | 35 | 29 | — | |
| Self-DistillationParadigm=Fine-tuning, Base Model=QwQ-32B, Notes=ablation2025.12 | 35 | 29 | — | |
| GRPOParadigm=Fine-tuning, Base Model=Qwen2.5-7B-Instruct2025.12 | 32 | 11 | — | |
| PPOParadigm=Fine-tuning, Base Model=Qwen2.5-7B-Instruct2025.12 | 31 | 14 | — | |
| NLQLParadigm=Fine-tuning, Base Model=Qwen2.5-7B-Instruct, Notes=ablation2025.12 | 29 | 19 | — | |
| NLRLParadigm=Fine-tuning, Base Model=Qwen2.5-7B-Instruct2025.12 | 25 | 16 | — | |
| IterResearchModel=DeepSeek-V3.2-Exp2026.01 | 24.3 | 42 | 27 | |
| Self-DistillationParadigm=Fine-tuning, Base Model=Qwen2.5-7B-Instruct, Notes=ablation2025.12 | 24 | 14 | — | |
| ReActModel=Qwen3-4B2026.01 | 22.6 | 32 | 1.1 | |
| U-FoldModel=Qwen3-4B2026.01 | 21.7 | 34 | — | |
| RFTParadigm=Fine-tuning, Base Model=Qwen2.5-7B-Instruct2025.12 | 21 | 13 | — | |
| ReSumModel=Qwen3-4B2026.01 | 20 | 30 | 3.7 | |
| IterResearchModel=Qwen3-4B2026.01 | 19.1 | 26 | 3.7 |