Multimodal Question Answering on WebQA 3 (test)
79.5Accuracy (%)CogniVerse
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| CogniVerseBackbone=LLaVA-13B, retrieval=hyperbolic embedding space2026.05 | 79.5 | 0.89 | 74.6 | 0.4 | |
| MMCoQAretrieval=sequence-level objectives2026.05 | 72.6 | 0.82 | 67.4 | 0.43 | |
| GraphRAGretrieval=static knowledge graphs2026.05 | 70.1 | 0.79 | 64.8 | 0.48 | |
| MuRAGretrieval=Euclidean embeddings2026.05 | 68.4 | 0.78 | 61.2 | 0.46 | |
| BLIP-2retrieval=none2026.05 | 61.8 | 0.74 | — | 0.19 | |
| CLIP-ViT-Lretrieval=none, fine-tuned=true2026.05 | 55.3 | 0.68 | — | 0.13 |