Multimodal Understanding on MMBench en cn
62.6MMBench English ScoreVisNec
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VisNecBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 62.6 | 53.1 | |
| Full-Data(186K)Backbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=100%2026.03 | 53.4 | 48.2 | |
| CoIDOBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 51.4 | 47.3 | |
| ICONSBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 51.3 | 45.4 | |
| XMASBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 51.1 | 44 | |
| PreSelBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 50.4 | 45.4 | |
| COINCIDEBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 49.6 | 48.2 | |
| EL2NBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 44.7 | 37.7 | |
| RandomBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 43.6 | 43.1 | |
| Self-FilterBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 42.1 | 43.8 | |
| CLIP-ScoreBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 37.5 | 44.2 | |
| TypiClustBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 32.4 | 45.1 | |
| IFDBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 30.4 | 40.8 |