ResearchTasksRole-playing Dialogue EvaluationFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast UpdatedFURINA-Bench Englisho342.99Context Reliance15Apr 7, 2026FURINA-Bench ChineseQwen3-32B71.39Context Reliance12Apr 7, 2026RoleChat gold-standard evaluation setGPT-4.196.6Logical Coherence10Apr 16, 2026