Multimodal Evaluation on SEED-Bench Image (Accuracy)
77.39AccuracyRADIOv2.5-H
Evaluation Results
| Method | Links | |
|---|---|---|
| RADIOv2.5-HVision Encoder=RADIOv2.5-H, LLM=Qwen2-7B-Instruct, SFT Data Mixture=9.8M samples, Tokens per image=5122024.12 | 77.39 | |
| RADIOv2.5-HResolution=768², Tokens per image=512, LLM=Qwen2-7B-Instruct, Training Data=ShareGPT4v and VFLAN2024.12 | 75.4 | |
| RADIOv2.5-H + TilingVision Encoder=RADIOv2.5-H (ours) + Tiling, Resolution=Up to 7 × 768², Compression=ToMe r=2108, Tokens/im=~ 12332024.12 | 75.3 | |
| RADIOv2.5-HResolution=768², Tokens per image=196, LLM=Qwen2-7B-Instruct, Training Data=ShareGPT4v and VFLAN2024.12 | 75.1 | |
| SigLIP SO400M + TilingVision Encoder=SigLIP SO400M [52] + Tiling, Resolution=Up to 13 × 384², Compression=2 × 2 Unshuffle, Tokens/im=~ 19282024.12 | 74.4 | |
| SigLIP-SO400MResolution=384², Tokens per image=196, LLM=Qwen2-7B-Instruct, Training Data=ShareGPT4v and VFLAN2024.12 | 74.2 | |
| RADIOv2.5-HVision Encoder=RADIOv2.5-H (ours), Resolution=768², Compression=ToMe r=2108, Tokens/im=1962024.12 | 74.1 | |
| SigLIP-SO400MVision Encoder=SigLIP-SO400M, LLM=Qwen2-7B-Instruct, SFT Data Mixture=9.8M samples, Tokens per image=5122024.12 | 72 | |
| AM-RADIO-HResolution=512², Tokens per image=256, LLM=Qwen2-7B-Instruct, Training Data=ShareGPT4v and VFLAN2024.12 | 71.8 | |
| OpenAI-CLIPResolution=336², Tokens per image=144, LLM=Qwen2-7B-Instruct, Training Data=ShareGPT4v and VFLAN2024.12 | 66.7 |