Tool Generation on ToolBench (test)
28.3DiffLM Win RateDiffLM
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DiffLMEvaluator=GPT-4, Evaluation Protocol=Category-level preference scoring, Criteria=Comprehensiveness and diversity2024.11 | 28.3 | 6.8 | 64.9 |
| Method | Links | |||
|---|---|---|---|---|
| DiffLMEvaluator=GPT-4, Evaluation Protocol=Category-level preference scoring, Criteria=Comprehensiveness and diversity2024.11 | 28.3 | 6.8 | 64.9 |