Visual Question Answering on Multimodal Reasoning Benchmarks
32.97FlipVQA AccuracyOurs
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| OursModel=Ours2025.11 | 32.97 | 66.22 | 47.39 | 64.14 | 71.37 | 70.1 | 35.62 | 55.4 | |
| Qwen3-VL-8B-InstructModel=Qwen3-VL-8B-Instruct2025.11 | 24.45 | 65.78 | 42.54 | 57.35 | 66.73 | 70.3 | 29.79 | 50.99 |