ResearchBenchmarksReasoning-chain quality evaluation on CoT Quality Evaluation LLM-as-Judge GPT-5.4-thinkingFollow67.6CompletenessFull-CoT56.78459.59262.465.208May 17, 2026Evaluation ResultsMethodMethodLinksCompletenessCoherenceConcisenessJustificationAverage Quality ScoreFull-CoT2026.0567.641.515.751.844.1PUMA2026.0564.857.540.254.854.3CCoT2026.0564.151.630.554.550.2Plan&Budget2026.0562.548.627.251.647.5DEER2026.0562.437.919.146.741.5CoD2026.05624926.150.346.8Dynasor2026.0557.246.92546.543.9