ResearchDatasetsCoT Quality EvaluationFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsReasoning-chain quality evaluationCoT Quality Evaluation LLM-as-Judge GPT-5.4-thinking67.6Completeness7
Reasoning-chain quality evaluationCoT Quality Evaluation LLM-as-Judge GPT-5.4-thinking67.6Completeness7