Visual Question Answering on SV-QA (V*)
83.3Q1 AccuracyDeepEyes
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DeepEyesReasoning Paradigm=Text + Visual Cropping2026.05 | 83.3 | 79.1 | 70.2 | |
| SLVR-7BReasoning Paradigm=Visual + Semantic Latent2026.05 | 82.2 | 80.1 | 69.1 | |
| LVRReasoning Paradigm=Visual Latent2026.05 | 81.7 | 77.5 | 65.4 | |
| Qwen2.5-VL-7BReasoning Paradigm=Text-only2026.05 | 76.4 | 55.5 | 44 | |
| Visual-SR1Reasoning Paradigm=Text CoT2026.05 | 75.9 | 73.3 | 62.8 | |
| GRITReasoning Paradigm=Text CoT2026.05 | 69.6 | 61.8 | 49.7 |