ResearchBenchmarksHigh-level Planning on ReasonMap L (long questions)Follow0.0747Weighted AccuracyAriadne0.0396520.0487510.057850.066949Nov 1, 2025Evaluation ResultsMethodMethodLinksWeighted AccuracyToken CountWeighted Map ScoreAriadneBackbone=Qwen2.5-VL-7B...Backbone=Qwen2.5-VL-7B-Instruct2025.110.07471215.15Base VLMBackbone=Qwen2.5-VL-7B...Backbone=Qwen2.5-VL-7B-Instruct2025.110.06614.51SFT VLMBackbone=Qwen2.5-VL-7B...Backbone=Qwen2.5-VL-7B-Instruct2025.110.041503.71