ResearchBenchmarksUser-Agent Dialogue Evaluation on TRACE Overall (test)Follow82AccuracyRM66.470.4574.578.55Oct 22, 2025Evaluation ResultsMethodMethodLinksAccuracyF1 ScorePrecisionRecallRMLLM/RM=SkyworkLLM/RM=Skywork2025.1082757182SCOPELLM/RM=Sonnet-3.5LLM/RM=Sonnet-3.52025.1079766198SCOPELLM/RM=GPT-4.1LLM/RM=GPT-4.12025.1079766299G-EvalLLM/RM=Sonnet-3.5LLM/RM=Sonnet-3.52025.10777459100G-EvalLLM/RM=GPT-4.1LLM/RM=GPT-4.12025.10767358100SPURLLM/RM=Sonnet-3.5LLM/RM=Sonnet-3.52025.10696851100SPURLLM/RM=GPT-4.1LLM/RM=GPT-4.12025.10676750100