Multimodal Benchmarking on MMBench (Language Specific Scores)
77MMBench Score (en)DPVR-PC
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DPVR-PCModel Scale=13B, Split layer (s)=282026.06 | 77 | 74 | |
| DPVR-PCModel Scale=13B, Split layer (s)=202026.06 | 76.9 | 73.8 | |
| DPVR-PCModel Scale=13B, Split layer (s)=242026.06 | 76.8 | 73.9 | |
| DPVR-LFModel Scale=13B, Split layer (s)=282026.06 | 76.6 | 73.9 | |
| DPVR-PCModel Scale=13B, Split layer (s)=342026.06 | 76.5 | 73.9 | |
| LLaVA-JPEG-901+Fine-tuned=Yes (1 additional epoch), Input=JPEG images, JPEG quality=902024.11 | 67.09 | 57.3 | |
| LLaVA-OriFine-tuned=No, Input=Original images2024.11 | 66.67 | 58.93 | |
| LLaVA-JPEG-90Fine-tuned=No, Input=JPEG images, JPEG quality=902024.11 | 66.32 | 58.59 | |
| LLaVA-Ori1+Fine-tuned=Yes (1 additional epoch), Input=Original images2024.11 | 65.64 | 57.56 | |
| LLaVA-AlignedVQFine-tuned=No, Input=AlignedVQ features2024.11 | 65.37 | 56.7 | |
| VisNecSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 64.9 | 59.1 | |
| PreSelSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 64.8 | 56.5 | |
| Full-Data(665K)Sampling Ratio=100% (665K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 64.3 | 58.3 | |
| TypiClustSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 64.3 | 57.1 | |
| XMASSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 64.3 | 54.1 | |
| LLaVA-JPEG-10Fine-tuned=No, Input=JPEG images, JPEG quality=102024.11 | 64.17 | 54.46 | |
| CoIDOSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 63.3 | 55.5 | |
| ICONSSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 63.1 | 55.8 | |
| LLaVA-JPEG-101+Fine-tuned=Yes (1 additional epoch), Input=JPEG images, JPEG quality=102024.11 | 63.05 | 54.2 | |
| RandomSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 61 | 53.5 | |
| COINCIDESampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 60.5 | 53.9 | |
| EL2NSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 58.2 | 48.5 | |
| IFDSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 57.2 | 50.6 | |
| Full-FinetuneDataset=Vision-Flan-186K, #Data=186k2026.05 | 52.6 | 45.9 | |
| MAGICDataset=Vision-Flan-186K, #Data=∼37k2026.05 | 52 | 46.5 | |
| CLIP-ScoreSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 51 | 48 | |
| Self-FilterSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 48.1 | 45.4 | |
| RandomDataset=Vision-Flan-186K, #Data=∼37k2026.05 | 46.5 | 39.6 |