ResearchDatasetsMLLM-as-a-Judge, RichHF, GenAI-BenchFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsMultimodal Evaluation ConsistencyMLLM-as-a-Judge, RichHF-18K, GenAI-Bench44.2Average Score22