Visual Question Answering on SQA-I
72.7SQA-I AccuracyLLaVA-1.5-13B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LLaVA-1.5-13BImg/s=2.22, Speedup=-2025.10 | 72.7 | — | |
| APTBase Model=LLaVA-1.5-13B, Img/s=2.72, Speedup=+23%2025.10 | 72.4 | — | |
| RandomBase Model=LLaVA-1.5-13B, Img/s=2.79, Speedup=+26%2025.10 | 72 | — | |
| ResizingBase Model=LLaVA-1.5-13B, Img/s=2.72, Speedup=+23%2025.10 | 72 | — | |
| PreSelReq. Inst.=15%, Sel. Inst.=93K2025.03 | 70.1 | 97.9 | |
| PreSelSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 70.1 | — | |
| LLaVA-1.5-7BReq. Inst.=100%, Sel. Inst.=665K2025.03 | 68.4 | 100 | |
| Full-Data(665K)Sampling Ratio=100% (665K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 68.4 | — | |
| Qwen-VL-ChatReq. Inst.=100%, Sel. Inst.=50M2025.03 | 68.2 | — | |
| TypiClustReq. Inst.=15%, Sel. Inst.=93K2025.03 | 68.2 | 96.8 | |
| TypiClustSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 68.2 | — | |
| CoIDOSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 68.2 | — | |
| VisNecSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 67.9 | — | |
| RandomReq. Inst.=15%, Sel. Inst.=93K2025.03 | 67.8 | 95.7 | |
| RandomSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 67.8 | — | |
| LLaVA-1.5-7BImg/s=3.70, Speedup=-2025.10 | 67.8 | — | |
| COINCIDEReq. Inst.=100%, Sel. Inst.=93K2025.03 | 67.7 | 95.5 | |
| COINCIDESampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 67.7 | — | |
| APTBase Model=LLaVA-1.5-7B, Img/s=4.51, Speedup=+22%2025.10 | 67.5 | — | |
| PerplexityReq. Inst.=100%, Sel. Inst.=93K2025.03 | 67.2 | 91.9 | |
| RandomBase Model=LLaVA-1.5-7B, Img/s=4.58, Speedup=+24%2025.10 | 67.2 | — | |
| XMASSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 67 | — | |
| ResizingBase Model=LLaVA-1.5-7B, Img/s=4.51, Speedup=+22%2025.10 | 66.8 | — | |
| EL2NReq. Inst.=100%, Sel. Inst.=93K2025.03 | 66.5 | 93 | |
| IFDReq. Inst.=100%, Sel. Inst.=93K2025.03 | 66.5 | 91.8 | |
| EL2NSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 66.5 | — | |
| IFDSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 66.5 | — | |
| ICONSSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 65.3 | — | |
| CLIP-ScoreReq. Inst.=100%, Sel. Inst.=93K2025.03 | 64.5 | 90.3 | |
| CLIP-ScoreSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 64.5 | — | |
| Self-FilterReq. Inst.=100%, Sel. Inst.=93K2025.03 | 62.3 | 88.8 | |
| Self-FilterSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 62.3 | — | |
| BLIP-2Req. Inst.=100%2025.03 | 61 | — | |
| InstructBLIP-7BReq. Inst.=100%, Sel. Inst.=1.2M2025.03 | 60.5 | — |