Multimodal Understanding on AI2D, POPE, TextVQA, OKVQA, VizWiz, COCO Caption, NoCaps, and RealWorldQA
99.86Average ScoreALVTS
Evaluation Results
| Method | Links | |
|---|---|---|
| ALVTSRatio=67%, Base Model=LLaVA-1.5-13B2026.06 | 99.86 | |
| DARTRatio=67%, Base Model=LLaVA-1.5-13B2026.06 | 99.16 | |
| ALVTSRatio=78%, Base Model=LLaVA-1.5-13B2026.06 | 99.12 | |
| FastVRatio=67%, Base Model=LLaVA-1.5-13B2026.06 | 98.71 | |
| PDropRatio=67%, Base Model=LLaVA-1.5-13B2026.06 | 97.88 | |
| DARTRatio=78%, Base Model=LLaVA-1.5-13B2026.06 | 97.41 | |
| ALVTSRatio=89%, Base Model=LLaVA-1.5-13B2026.06 | 96.63 | |
| PDropRatio=78%, Base Model=LLaVA-1.5-13B2026.06 | 96.56 | |
| FastVRatio=78%, Base Model=LLaVA-1.5-13B2026.06 | 96.41 | |
| DARTRatio=89%, Base Model=LLaVA-1.5-13B2026.06 | 93.98 | |
| PDropRatio=89%, Base Model=LLaVA-1.5-13B2026.06 | 92.66 | |
| FastVRatio=89%, Base Model=LLaVA-1.5-13B2026.06 | 91.2 | |
| VTWRatio=67%, Base Model=LLaVA-1.5-13B2026.06 | 85.19 | |
| VTWRatio=78%, Base Model=LLaVA-1.5-13B2026.06 | 69.16 | |
| VTWRatio=89%, Base Model=LLaVA-1.5-13B2026.06 | 48.35 |