Multi-hop Question Answering on MMhops Comparison (test)
29.39AccuracyGemini-2.5-pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-2.5-pro2025.12 | 29.39 | |
| Gemini-2.5-flash2025.12 | 23.18 | |
| MMhops-R1Base Model=Qwen2.5-vl-7B-Instruct, Retriever=Image, Text2025.12 | 22.01 | |
| Self-AskBase Model=GPT-4o, Retriever=Caption, Text2025.12 | 18.27 | |
| OmniSearchBase Model=GPT-4o, Retriever=Image, Text2025.12 | 17.02 | |
| Vanilla mRAGBase Model=Qwen2.5-vl-7B-Instruct, Retriever=Image, Text2025.12 | 9.72 | |
| GPT-4o2025.12 | 8.76 | |
| Zero-shotBase Model=Qwen2.5-vl-72B-Instruct2025.12 | 7.59 | |
| GPT-4o-mini2025.12 | 7.05 | |
| Search-r1Base Model=Qwen2.5-7b-Instruct, Retriever=Caption, Text2025.12 | 6.62 | |
| Zero-shotBase Model=Qwen2.5-vl-7B-Instruct2025.12 | 6.2 | |
| EchoSightBase Model=LLaMA3, Retriever=Image, Text2025.12 | 4.81 | |
| Vanilla mRAGBase Model=Qwen2.5-vl-7B-Instruct, Retriever=Text2025.12 | 3.95 |