Multi-image Multi-modal Understanding on Q-Bench
74.4AccuracyLLaVA-OneVision-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaVA-OneVision-7BModel=LLaVA-OneVision-7B, Tokens per image=7292026.01 | 74.4 | |
| VisionTrim on LLaVA-OneVision-7BModel=LLaVA-OneVision-7B, Tokens per image=2432026.01 | 74.3 |