ResearchDatasetsMT-EvalFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsMulti-turn dialogueMT-Eval8.16LLM-EVAL Score20Multi-turn Instruction FollowingMT-Eval93.62CSR20Multi-turn dialogue evaluationMT-Eval7.34Expansion Score9Multi-turn conversationMT-Eval8.28Accuracy9Structured Reasoning and EvaluationMT-Eval95.56CSR8