Visual Question Answering on OKVQA (Accuracy)
64.56AccuracyVanilla
Evaluation Results
| Method | Links | |
|---|---|---|
| VanillaBackbone=Qwen2.5-VL-7B, Token budget=100%2026.04 | 64.56 | |
| FastVBackbone=Qwen2.5-VL-7B, Token budget=25%2026.04 | 63.89 | |
| DARTBackbone=Qwen2.5-VL-7B, Token budget=25%2026.04 | 63.83 | |
| DivPruneBackbone=Qwen2.5-VL-7B, Token budget=25%2026.04 | 63.46 | |
| InternVL-2.0Params # trainable=8B, Text Backbone=AR, Image Backbone=-2026.05 | 62.9 | |
| SLVR-7BReasoning Paradigm=Visual + Semantic Latent2026.05 | 61.8 | |
| DASHBackbone=Qwen2.5-VL-7B, Token budget=25%2026.04 | 61.73 | |
| DeFactoBackbone=Qwen2.5-VL-7B2025.09 | 61.7 | |
| Qwen2.5-VL-7BReasoning Paradigm=Text-only2026.05 | 58.9 | |
| Qwen2.5-VLBackbone=Qwen2.5-VL-7B2025.09 | 58.9 | |
| LoRAModel=Qwen2.5-VL-3B, Optimization=FlatPO2026.06 | 53.8 | |
| LoRAModel=Qwen2.5-VL-3B, Optimization=SAM2026.06 | 52.2 | |
| LoRAModel=Qwen2.5-VL-3B, Optimization=GAM2026.06 | 52 | |
| Prefix TuningModel=Qwen2.5-VL-3B, Optimization=FlatPO2026.06 | 52 | |
| Prefix TuningModel=Qwen2.5-VL-3B, Optimization=SAM2026.06 | 51.6 | |
| LoRAModel=Qwen2.5-VL-3B, Optimization=Base2026.06 | 51.1 | |
| Prefix TuningModel=Qwen2.5-VL-3B, Optimization=GAM2026.06 | 50.9 | |
| LVRReasoning Paradigm=Visual Latent2026.05 | 50.6 | |
| Prefix TuningModel=Qwen2.5-VL-3B, Optimization=Base2026.06 | 50.4 | |
| Visual-SR1Reasoning Paradigm=Text CoT2026.05 | 49 | |
| Visual-SR1Backbone=Qwen2.5-VL-7B2025.09 | 49 | |
| FlamingoParams # trainable=9B, Text Backbone=AR, Image Backbone=-2026.05 | 44.7 | |
| GRITReasoning Paradigm=Text CoT2026.05 | 43.1 | |
| GRITBackbone=Qwen2.5-VL-3B2025.09 | 43.1 | |
| DeepEyesReasoning Paradigm=Text + Visual Cropping2026.05 | 40 | |
| DeepEyesBackbone=Qwen2.5-VL-7B2025.09 | 40 | |
| DualDiff (256x256)Params # trainable=2B, Text Backbone=FM, Image Backbone=FM2026.05 | 28.5 | |
| DualDiffTrainable Params=2B, Training resolution=2562026.05 | 28.5 | |
| DualDiff (512x512)Params # trainable=2B, Text Backbone=FM, Image Backbone=FM2026.05 | 25.3 | |
| DualDiffTrainable Params=2B, Training resolution=5122026.05 | 25.3 | |
| CM3LeonParams # trainable=7B, Text Backbone=AR, Image Backbone=AR2026.05 | 23.8 | |
| CM3LeonTrainable Params=7B2026.05 | 23.8 | |
| FullFlowParams # trainable=130M, Text Backbone=FM, Image Backbone=FM2026.05 | 23.3 | |
| FullFlowTrainable Params=130M2026.05 | 23.3 |