ResearchBenchmarksVisual Question Answering on CLEVR-style synthetic 10 scenes (test)Follow34Accuracy (Exist)Baseline27.7629.383132.62Jun 15, 2026Evaluation ResultsMethodMethodLinksAccuracy (Exist)Accuracy (Count)Accuracy (Query Color)Accuracy (Query Shape)Accuracy (Spatial)Total AccuracyBaselineinference_type=direct...inference_type=direct MLLM inference2026.063418133068Gen-VCoTapproach=visual chain-...approach=visual chain-of-thought2026.062815103056