Visual Question Answering on FVQA
82.82AccuracyStaR-KVQA_Qwen
Evaluation Results
| Method | Links | |
|---|---|---|
| StaR-KVQA_QwenBackbone=Qwen2.5-VL-7B, Training=Fine-tuned2025.10 | 82.82 | |
| StaR-KVQA_GemmaBackbone=Gemma-3-12B, Training=Fine-tuned2025.10 | 81.2 | |
| StaR-KVQA_LlamaBackbone=Llama-3.2-11B-Vision, Training=Fine-tuned2025.10 | 80.19 | |
| SimpleSearch-VL-30B-A3BEvaluation Paradigm=Multimodal Search Agents2026.06 | 79 | |
| LLaVA-CoTBackbone=Llama-3.2-11B-Vision, Training=Fine-tuned2025.10 | 78.45 | |
| Gemma-3-27BBackbone=Gemma-3-27B2025.10 | 76.82 | |
| SimpleSearch-VL-8BEvaluation Paradigm=Multimodal Search Agents2026.06 | 76.8 | |
| Gemini-3-ProEvaluation Paradigm=Agentic Workflow2026.06 | 76.7 | |
| Kimi-K2.5Evaluation Paradigm=Agentic Workflow2026.06 | 76.5 | |
| Qwen2.5-VL-72BBackbone=Qwen2.5-VL-72B2025.10 | 75.95 | |
| SDFTBackbone=Qwen2.5-VL-7B, Training=Self-Distillation Fine-Tuning2025.10 | 75.54 | |
| CoT + SFTBackbone=Qwen2.5-VL-7B, Training=Fine-tuned, Mode=Chain-of-Thought2025.10 | 75.13 | |
| CoTBackbone=Qwen2.5-VL-7B, Mode=Chain-of-Thought2025.10 | 74.66 | |
| Gemini 2.5 Flash2025.10 | 74.51 | |
| Claude-Opus-4.6Evaluation Paradigm=Agentic Workflow2026.06 | 74.5 | |
| Vision-DeepResearch-30B-A3BEvaluation Paradigm=Multimodal Search Agents2026.06 | 74.2 | |
| SFTBackbone=Qwen2.5-VL-7B, Training=Fine-tuned2025.10 | 73.91 | |
| Gemini 2.5 Pro2025.10 | 73.39 | |
| OpenSearch-VL-30B-A3BEvaluation Paradigm=Multimodal Search Agents2026.06 | 73.2 | |
| SenseNova-MARS-32BEvaluation Paradigm=Multimodal Search Agents2026.06 | 72.6 | |
| M2-ReasoningBackbone=M2-Reasoning-7B2025.10 | 72.53 | |
| GPT-4o2025.10 | 72.36 | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B2025.10 | 71.61 | |
| OpenSearch-VL-8BEvaluation Paradigm=Multimodal Search Agents2026.06 | 71.5 | |
| POINTS-Seeker-8BEvaluation Paradigm=Multimodal Search Agents2026.06 | 71.2 | |
| InternVL3-78BBackbone=InternVL3-78B2025.10 | 70.99 | |
| Gemma-3-12BBackbone=Gemma-3-12B2025.10 | 70.64 | |
| MM-DeepResearch-8BEvaluation Paradigm=Multimodal Search Agents2026.06 | 69.2 | |
| GoG-3-8B-Think-RLEvaluation Methodology=Search-Equipped Models2026.01 | 68.44 | |
| Qwen3-VL-30B-A3BEvaluation Paradigm=Agentic Workflow2026.06 | 67.4 | |
| SenseNova-MARS-8BEvaluation Paradigm=Multimodal Search Agents2026.06 | 67.1 | |
| GoG-2.5-7B-RLEvaluation Methodology=Search-Equipped Models2026.01 | 66.78 | |
| Llama-3.2-11B-VisionBackbone=Llama-3.2-11B-Vision2025.10 | 66.09 | |
| Qwen3-VL-8BEvaluation Paradigm=Agentic Workflow2026.06 | 65.3 | |
| Vision-DeepResearch-8BEvaluation Paradigm=Multimodal Search Agents2026.06 | 64.7 | |
| WebWatcher-32BEvaluation Paradigm=Multimodal Search Agents2026.06 | 64.3 | |
| GoG-3-8B-Think-SFTEvaluation Methodology=Search-Equipped Models2026.01 | 62.17 | |
| Qwen2.5-VL-7BEvaluation Methodology=Full-Search Workflow2026.01 | 61.06 | |
| DeepEyesV2-7BEvaluation Paradigm=Multimodal Search Agents2026.06 | 60.6 | |
| Claude-Opus-4.6Evaluation Paradigm=Direct Answer2026.06 | 60.1 | |
| Kimi-K2.5Evaluation Paradigm=Direct Answer2026.06 | 59.6 | |
| Gemini-3-ProEvaluation Paradigm=Direct Answer2026.06 | 58.9 | |
| MMSearch-R1-7BEvaluation Paradigm=Multimodal Search Agents2026.06 | 58.4 | |
| Qwen3-VL-8B-ThinkingEvaluation Methodology=Full-Search Workflow2026.01 | 57.33 | |
| GoG-2.5-7B-SFTEvaluation Methodology=Search-Equipped Models2026.01 | 53.72 | |
| Qwen3-VL-8B-ThinkEvaluation Methodology=Prompt-based GoG Method2026.01 | 51.33 | |
| MMSearch-R1*Evaluation Methodology=Search-Equipped Models2026.01 | 42.39 | |
| GPT-4oEvaluation Methodology=Direct Answer2026.01 | 42 | |
| Qwen3-VL-30B-A3BEvaluation Paradigm=Direct Answer2026.06 | 34.7 | |
| Qwen3-VL-30B-A3B-ThinkingEvaluation Methodology=Direct Answer2026.01 | 31.11 | |
| Qwen3-VL-8BEvaluation Paradigm=Direct Answer2026.06 | 28 | |
| Qwen2.5-VL-32BEvaluation Methodology=Direct Answer2026.01 | 26.89 | |
| Qwen3-VL-30B-A3B-InstructEvaluation Methodology=Direct Answer2026.01 | 26.11 | |
| Qwen2.5-VL-7BEvaluation Methodology=Direct Answer2026.01 | 25.33 | |
| Qwen3-VL-8B-ThinkingEvaluation Methodology=Direct Answer2026.01 | 24.56 | |
| Qwen2.5-VL-7BEvaluation Methodology=Prompt-based GoG Method2026.01 | 24.5 | |
| Qwen3-VL-8B-InstructEvaluation Methodology=Direct Answer2026.01 | 23.94 |