Function-calling on Tau-bench Airline
50Success RateDream-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| Dream-7BPrompt Optimizer=Dream-7B (DLM), Evaluation Model=GPT-4o-mini2026.01 | 50 | |
| TextGradPrompt Optimizer=TextGrad (Gradient-based), Evaluation Model=GPT-4o-mini2026.01 | 50 | |
| BaselineDescription=Original prompts, Evaluation Model=GPT-4o-mini2026.01 | 43 | |
| Qwen3-8BPrompt Optimizer=Qwen3-8B (AR), Evaluation Model=GPT-4o-mini2026.01 | 42 | |
| Llama3-8BPrompt Optimizer=Llama3-8B (AR), Evaluation Model=GPT-4o-mini2026.01 | 41 |