Visual Question Answering on ScienceQA (SQA)
89.3SQA AccuracyLocoRE
Evaluation Results
| Method | Links | |
|---|---|---|
| LocoREBackbone=Qwen2.5-VL, Model Size=32B, Inference Strategy=LocoRE2026.01 | 89.3 | |
| Qwen2.5-VL-32BBackbone=Qwen2.5-VL, Model Size=32B, Inference Strategy=Base2026.01 | 89 | |
| SGRS + LocoREBackbone=Qwen2.5-VL, Model Size=7B, Inference Strategy=SGRS + LocoRE2026.01 | 82.1 | |
| LocoREBackbone=Qwen2.5-VL, Model Size=7B, Inference Strategy=LocoRE2026.01 | 80.8 | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL, Model Size=7B, Inference Strategy=Base2026.01 | 79 | |
| SGRS + LocoREBackbone=LLaVA-1.5, Model Size=13B, Inference Strategy=SGRS + LocoRE2026.01 | 75.5 | |
| SGRS + LocoREBackbone=Qwen2-VL, Model Size=7B, Inference Strategy=SGRS + LocoRE2026.01 | 75.3 | |
| VisionZipBackbone=LLaVA-1.5-13B, Token Budget=64 Tokens2026.06 | 74.4 | |
| LocoREBackbone=Qwen2-VL, Model Size=7B, Inference Strategy=LocoRE2026.01 | 74.2 | |
| DARTBackbone=LLaVA-1.5-13B, Token Budget=128 Tokens2026.06 | 74.2 | |
| Qwen2-VL-7BBackbone=Qwen2-VL, Model Size=7B, Inference Strategy=Base2026.01 | 74.1 | |
| VisionZipBackbone=LLaVA-1.5-13B, Token Budget=128 Tokens2026.06 | 74 | |
| DARTBackbone=LLaVA-1.5-13B, Token Budget=64 Tokens2026.06 | 73.8 | |
| Zoo-PruneBackbone=LLaVA-1.5-13B, Token Budget=128 Tokens2026.06 | 73.4 | |
| STSBackbone=LLaVA-1.5-13B, Token Budget=128 Tokens2026.06 | 73.2 | |
| DARTBackbone=LLaVA-1.5-13B, Token Budget=32 Tokens2026.06 | 73.2 | |
| VisionZipBackbone=LLaVA-1.5-13B, Token Budget=32 Tokens2026.06 | 72.9 | |
| VanillaBackbone=LLaVA-1.5-13B, Token Budget=Full Tokens2026.06 | 72.8 | |
| DivPruneBackbone=LLaVA-1.5-13B, Token Budget=128 Tokens2026.06 | 72.8 | |
| AgilePruneBackbone=LLaVA-1.5-13B, Token Budget=128 Tokens2026.06 | 72.8 | |
| STSBackbone=LLaVA-1.5-13B, Token Budget=64 Tokens2026.06 | 72.6 | |
| STSBackbone=LLaVA-1.5-13B, Token Budget=32 Tokens2026.06 | 72.6 | |
| LocoREBackbone=LLaVA-1.5, Model Size=13B, Inference Strategy=LocoRE2026.01 | 72.5 | |
| Zoo-PruneBackbone=LLaVA-1.5-13B, Token Budget=64 Tokens2026.06 | 72.1 | |
| AgilePruneBackbone=LLaVA-1.5-13B, Token Budget=64 Tokens2026.06 | 72 | |
| LLaVA-1.5-13BBackbone=LLaVA-1.5, Model Size=13B, Inference Strategy=Base2026.01 | 71.6 | |
| DivPruneBackbone=LLaVA-1.5-13B, Token Budget=64 Tokens2026.06 | 71.3 | |
| SGRS + LocoREBackbone=Intern-VL, Model Size=13B, Inference Strategy=SGRS + LocoRE2026.01 | 71 | |
| DivPruneBackbone=LLaVA-1.5-13B, Token Budget=32 Tokens2026.06 | 70.9 | |
| LocoREBackbone=Intern-VL, Model Size=13B, Inference Strategy=LocoRE2026.01 | 70.4 | |
| Intern-VL-13BBackbone=Intern-VL, Model Size=13B, Inference Strategy=Base2026.01 | 70.1 | |
| CAMDBase Model=LLaVA-1.52026.03 | 68 | |
| SGRS + LocoREBackbone=Intern-VL, Model Size=7B, Inference Strategy=SGRS + LocoRE2026.01 | 67.9 | |
| LLaVA-1.5-7B + SIDBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=SID2026.01 | 67.8 | |
| SGRS + LocoREBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=SGRS + LocoRE2026.01 | 67.8 | |
| LocoREBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=LocoRE2026.01 | 67.5 | |
| LLaVA-1.5-7B + FarSightBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=FarSight2026.01 | 67.4 | |
| FarSightBase Model=LLaVA-1.52026.03 | 67.4 | |
| LLaVA-1.5-7B + VissinkBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=Vissink2026.01 | 67 | |
| CAMDBase Model=Video-LLaVA2026.03 | 66.9 | |
| LocoREBackbone=Intern-VL, Model Size=7B, Inference Strategy=LocoRE2026.01 | 66.4 | |
| Intern-VL-7BBackbone=Intern-VL, Model Size=7B, Inference Strategy=Base2026.01 | 66.2 | |
| FarSightBase Model=Video-LLaVA2026.03 | 66.2 | |
| LLaVA-1.5-7B + TAMEBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=TAME2026.01 | 66 | |
| LLaVA-1.5-7BBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=Base2026.01 | 65.5 | |
| LLaVA-1.5-7B + OPERABackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=OPERA2026.01 | 64.9 | |
| OPERABase Model=LLaVA-1.52026.03 | 64.9 | |
| Video-LLaVADecoding Strategy=Greedy2026.03 | 64.6 | |
| LLaVA-1.5Decoding Strategy=Greedy2026.03 | 64.5 | |
| CGDBase Model=LLaVA-1.52026.03 | 64 | |
| CAMDBase Model=InstructBLIP2026.03 | 63.6 | |
| FarSightBase Model=InstructBLIP2026.03 | 63.4 | |
| LLaVA-1.5-7B + VCDBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=VCD2026.01 | 63.3 | |
| VCDBase Model=LLaVA-1.52026.03 | 63.3 | |
| CAMDBase Model=Chat-UniVi2026.03 | 63 | |
| LLaVA-1.5-7B + ICDBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=ICD2026.01 | 62.8 | |
| ICDBase Model=LLaVA-1.52026.03 | 62.8 | |
| FarSightBase Model=Chat-UniVi2026.03 | 62.4 | |
| InstructBLIPDecoding Strategy=Greedy2026.03 | 62.1 | |
| Chat-UniViDecoding Strategy=Greedy2026.03 | 59.9 |