ResearchBenchmarksTask Planning on HuggingGPT Evaluation Dataset graph tasks GPT-4 annotatedFollow50.48GPT-4 ScoreGPT-3.511.646421.728231.8141.8918Mar 30, 2023Evaluation ResultsMethodMethodLinksGPT-4 ScorePrecisionRecallF1 ScoreGPT-3.5LLM=GPT-3.5LLM=GPT-3.52023.0350.4854.949.2351.91Vicuna-7bLLM=Vicuna-7bLLM=Vicuna-7b2023.0319.1713.9728.0818.66Alpaca-7bLLM=Alpaca-7bLLM=Alpaca-7b2023.0313.1416.1828.3320.59