Visual Question Answering on FutureVQA (test)
79.1Single-Trial AccuracyQwen2.5-VL-7b
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Qwen2.5-VL-7bVisual Label=Image2026.03 | 79.1 | 69.1 | 10 | 87.4 | |
| GPT-4oVisual Label=Image2026.03 | 76.2 | 66.1 | 11.1 | 86.7 | |
| Baseline*Visual Label=Image, Backbone=Hermes-Yi-34B2026.03 | 73.5 | 63.5 | 10.5 | 85.7 | |
| FutureAgent*Visual Label=Image, Backbone=Hermes-Yi-34B2026.03 | 72.3 | 64 | 7.8 | 89.2 | |
| Vid-LMA2Visual Label=Image & Video2026.03 | 67.6 | 54.3 | 13.3 | 80.3 | |
| GPT-4o-miniVisual Label=Image2026.03 | 66.9 | 54.5 | 12.4 | 81.5 | |
| LLV-VideoVisual Label=Image & Video2026.03 | 65.4 | 58.1 | 7.3 | 88.8 | |
| Baseline†Visual Label=Image, Backbone=Qwen-VL-32B2026.03 | 64.5 | 51.4 | 13.1 | 79.7 | |
| FutureAgent†Visual Label=Image, Backbone=Qwen-VL-32B2026.03 | 62.7 | 52.1 | 10.6 | 83.1 | |
| LLV-v1.5-13bVisual Label=Image2026.03 | 61 | 42.3 | 18.7 | 69.3 | |
| Yi-VL-34bVisual Label=Image2026.03 | 60.9 | 41.2 | 19.7 | 67.7 | |
| LLV-v1.5-7bVisual Label=Image2026.03 | 55.1 | 33.8 | 21.3 | 61.3 | |
| CogVLM-17bVisual Label=Image2026.03 | 53.1 | 29.3 | 23.8 | 44.8 | |
| LLV-Next-13bVisual Label=Image2026.03 | 41.8 | 18.7 | 23.1 | 44.7 | |
| Qwen-VL-7bVisual Label=Image2026.03 | 24.6 | 4.6 | 20 | 18.7 |