Multi-image Multi-modal Understanding on MuirBench
41.8AccuracyLLaVA-OneVision-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaVA-OneVision-7BModel=LLaVA-OneVision-7B, Tokens per image=7292026.01 | 41.8 | |
| VisionTrim on LLaVA-OneVision-7BModel=LLaVA-OneVision-7B, Tokens per image=2432026.01 | 41.4 |