ResearchBenchmarksVisual Question Answering on Complex synthetic scene 19 questionsFollow100Recognition AccuracyGen-VCoT9597.5100102.5Jun 15, 2026Evaluation ResultsMethodMethodLinksRecognition AccuracySpatial AccuracyDepth AccuracyCounting AccuracyAttribute AccuracyReasoning AccuracyTotal AccuracyGen-VCoTmode=Visual Chain-of-T...mode=Visual Chain-of-Thought2026.061004321415Baselinemode=Direct MLLM infer...mode=Direct MLLM inference2026.061003222313