ResearchDatasetsBigGen-BenchFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsPost-RL EvaluationBiGGen Bench63.7Accuracy5LLM-as-a-judgeBigGen-Bench (test)0.312Pearson Correlation4