Tool Use on tau-bench retail domain
57AccuracyQwen2.5-72B-CodeGym
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-72B-CodeGymCoT Pattern=Short-CoT, Training Strategy=CodeGym, Model Series=Qwen2.5, Model Size=72B, T=0.7, top-p=0.95, Inference Averaging=5 runs2025.09 | 57 | |
| Qwen2.5-32B-CodeGymCoT Pattern=Short-CoT, Training Strategy=CodeGym, Model Series=Qwen2.5, Model Size=32B, T=0.7, top-p=0.95, Inference Averaging=5 runs2025.09 | 54.4 | |
| Qwen2.5-72B-InstructCoT Pattern=Short-CoT, Training Strategy=Instruct, Model Series=Qwen2.5, Model Size=72B, T=0.7, top-p=0.95, Inference Averaging=5 runs2025.09 | 49.2 | |
| QwQ-32B-CodeGymCoT Pattern=Long-CoT, Training Strategy=CodeGym, Model Series=QwQ, Model Size=32B, T=0.7, top-p=0.95, Inference Averaging=5 runs2025.09 | 43 | |
| Qwen2.5-32B-InstructCoT Pattern=Short-CoT, Training Strategy=Instruct, Model Series=Qwen2.5, Model Size=32B, T=0.7, top-p=0.95, Inference Averaging=5 runs2025.09 | 41.4 | |
| Qwen2.5-14B-CodeGymCoT Pattern=Short-CoT, Training Strategy=CodeGym, Model Series=Qwen2.5, Model Size=14B, T=0.7, top-p=0.95, Inference Averaging=5 runs2025.09 | 39.2 | |
| QwQ-32BCoT Pattern=Long-CoT, Training Strategy=Base, Model Series=QwQ, Model Size=32B, T=0.7, top-p=0.95, Inference Averaging=5 runs2025.09 | 37.7 | |
| Qwen2.5-14B-InstructCoT Pattern=Short-CoT, Training Strategy=Instruct, Model Series=Qwen2.5, Model Size=14B, T=0.7, top-p=0.95, Inference Averaging=5 runs2025.09 | 32 | |
| Qwen2.5-7B-CodeGymCoT Pattern=Short-CoT, Training Strategy=CodeGym, Model Series=Qwen2.5, Model Size=7B, T=0.7, top-p=0.95, Inference Averaging=5 runs2025.09 | 7.6 | |
| Qwen2.5-7B-InstructCoT Pattern=Short-CoT, Training Strategy=Instruct, Model Series=Qwen2.5, Model Size=7B, T=0.7, top-p=0.95, Inference Averaging=5 runs2025.09 | 4.5 |