ResearchDatasetsBEAFFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsVision-Language ReasoningBEAF (test)88.4Simple Accuracy7Paired-prompt evaluationBEAF (sample)90.67Simple Accuracy2