ResearchTasksMLLM-as-a-judge evaluationFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast UpdatedVL RewardBenchM-Judger-RL-Qwen8B80.75Accuracy42Apr 21, 2026M-JudgeBenchM-Judger-RL-Qwen8B67.45Pairwise CoT Accuracy10Mar 4, 2026RewardBench MultimodalR1-Reward80.1Accuracy10Mar 4, 2026