Visual Question Answering on TextVQA with OCR hints (val)
71.5AccuracyRADIOv2.5-H
Evaluation Results
| Method | Links | |
|---|---|---|
| RADIOv2.5-HVision Encoder=RADIOv2.5-H, LLM=Qwen2-7B-Instruct, SFT Data Mixture=9.8M samples, Tokens per image=5122024.12 | 71.5 | |
| RADIOv2.5-HResolution=768², Tokens per image=196, LLM=Qwen2-7B-Instruct, Training Data=ShareGPT4v and VFLAN2024.12 | 70.8 | |
| RADIOv2.5-HResolution=768², Tokens per image=512, LLM=Qwen2-7B-Instruct, Training Data=ShareGPT4v and VFLAN2024.12 | 70.2 | |
| SigLIP-SO400MVision Encoder=SigLIP-SO400M, LLM=Qwen2-7B-Instruct, SFT Data Mixture=9.8M samples, Tokens per image=5122024.12 | 69.7 | |
| SigLIP-SO400MResolution=384², Tokens per image=196, LLM=Qwen2-7B-Instruct, Training Data=ShareGPT4v and VFLAN2024.12 | 67.6 | |
| OpenAI-CLIPResolution=336², Tokens per image=144, LLM=Qwen2-7B-Instruct, Training Data=ShareGPT4v and VFLAN2024.12 | 63.8 | |
| AM-RADIO-HResolution=512², Tokens per image=256, LLM=Qwen2-7B-Instruct, Training Data=ShareGPT4v and VFLAN2024.12 | 55.9 |