Multimodal long-horizon complex reasoning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
55.6Score
16
Jun 16, 2026
71.3Score
16
Jun 16, 2026
81.3Score
15
Jun 16, 2026
25.1Score
13
Jun 16, 2026
41.1Score
13
Jun 16, 2026
35.6Score
12
Jun 16, 2026