Multi-image Multi-modal Understanding on Mantis (Accuracy)
65.4AccuracyVisionTrim on LLaVA-OneVision-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| VisionTrim on LLaVA-OneVision-7BModel=LLaVA-OneVision-7B, Tokens per image=2432026.01 | 65.4 | |
| LLaVA-OneVision-7BModel=LLaVA-OneVision-7B, Tokens per image=7292026.01 | 64.2 |