Visual Question Answering on DynVQA
48.02AccuracyGoG-3-8B-Think-RL
Evaluation Results
| Method | Links | |
|---|---|---|
| GoG-3-8B-Think-RLEvaluation Methodology=Search-Equipped Models2026.01 | 48.02 | |
| GoG-3-8B-Think-SFTEvaluation Methodology=Search-Equipped Models2026.01 | 46.46 | |
| GoG-2.5-7B-RLEvaluation Methodology=Search-Equipped Models2026.01 | 42.21 | |
| Qwen3-VL-8B-ThinkEvaluation Methodology=Prompt-based GoG Method2026.01 | 41.36 | |
| Qwen2.5-VL-7BEvaluation Methodology=Full-Search Workflow2026.01 | 40.51 | |
| Qwen3-VL-8B-ThinkingEvaluation Methodology=Full-Search Workflow2026.01 | 39.09 | |
| GoG-2.5-7B-SFTEvaluation Methodology=Search-Equipped Models2026.01 | 38.53 | |
| MMSearch-R1*Evaluation Methodology=Search-Equipped Models2026.01 | 34.84 | |
| Qwen3-VL-30B-A3B-ThinkingEvaluation Methodology=Direct Answer2026.01 | 33 | |
| GPT-4oEvaluation Methodology=Direct Answer2026.01 | 31.59 | |
| Qwen3-VL-8B-ThinkingEvaluation Methodology=Direct Answer2026.01 | 30.31 | |
| Qwen3-VL-30B-A3B-InstructEvaluation Methodology=Direct Answer2026.01 | 26.91 | |
| Qwen3-VL-8B-InstructEvaluation Methodology=Direct Answer2026.01 | 22.24 | |
| Qwen2.5-VL-32BEvaluation Methodology=Direct Answer2026.01 | 20.96 | |
| Qwen2.5-VL-7BEvaluation Methodology=Prompt-based GoG Method2026.01 | 19.41 | |
| Qwen2.5-VL-7BEvaluation Methodology=Direct Answer2026.01 | 16.43 |