ResearchDatasetsBenchmark AFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsReasoningBenchmark A BBH and paradoxes 1.0 (test)94.7Accuracy4