ResearchBenchmarksHigh-level Planning on ReasonMap S (short questions)Follow15.44Weighted AccuracySFT VLM13.235213.807614.3814.9524Nov 1, 2025Evaluation ResultsMethodMethodLinksWeighted AccuracyOutput Token CountWeighted Map ScoreSFT VLMBackbone=Qwen2.5-VL-7B...Backbone=Qwen2.5-VL-7B-Instruct2025.1115.44253.79AriadneBackbone=Qwen2.5-VL-7B...Backbone=Qwen2.5-VL-7B-Instruct2025.1114.5433.67Base VLMBackbone=Qwen2.5-VL-7B...Backbone=Qwen2.5-VL-7B-Instruct2025.1113.32263.73