Scene Text-Centric Visual Question Answering on OCRVQA
64.4AccuracyMonkey
Evaluation Results
| Method | Links | |
|---|---|---|
| MonkeyModel Generation Capability=Text only2024.07 | 64.4 | |
| mPLUG-Owl2Model Generation Capability=Text only2024.07 | 58.7 | |
| LLaVA1.5-7BModel Generation Capability=Text only2024.07 | 58.1 | |
| TextHarmony-ChatModel Generation Capability=Text and image, Slide-LoRA=true2024.07 | 57.6 | |
| DocPediaModel Generation Capability=Text only2024.07 | 57.2 | |
| TextHarmonyModel Generation Capability=Text and image, Slide-LoRA=true2024.07 | 55.3 | |
| TextHarmony*Model Generation Capability=Text and image, Slide-LoRA=false2024.07 | 51.9 | |
| InternLM-XComposer2Model Generation Capability=Text only2024.07 | 49.6 | |
| UniDocModel Generation Capability=Text only2024.07 | 36.8 | |
| InternVLModel Generation Capability=Text only2024.07 | 30.5 | |
| LLaVARModel Generation Capability=Text only2024.07 | 24 | |
| SEED-LLaMA-14BModel Generation Capability=Text and image2024.07 | 16.3 | |
| MM-InterleavedModel Generation Capability=Text and image2024.07 | 11.7 | |
| MiniGPT5Model Generation Capability=Text and image2024.07 | 2.3 |