ResearchBenchmarksUser-Agent Dialogue Evaluation on TRACE Hard Neg. (test)Follow70AccuracyRM-2.816.13553.9Oct 22, 2025Evaluation ResultsMethodMethodLinksAccuracyF1 ScorePrecisionRecallRMLLM/RM=SkyworkLLM/RM=Skywork2025.1070———G-EvalLLM/RM=GPT-4.1LLM/RM=GPT-4.12025.1042———SCOPELLM/RM=GPT-4.1LLM/RM=GPT-4.12025.1042———G-EvalLLM/RM=Sonnet-3.5LLM/RM=Sonnet-3.52025.1037———SCOPELLM/RM=Sonnet-3.5LLM/RM=Sonnet-3.52025.1032———SPURLLM/RM=Sonnet-3.5LLM/RM=Sonnet-3.52025.102———SPURLLM/RM=GPT-4.1LLM/RM=GPT-4.12025.100———