Multi-modal Instruction Following on LLaVA-Wild
69.8Average ScoreVisNec
Evaluation Results
| Method | Links | |
|---|---|---|
| VisNecSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 69.8 | |
| Full-Data(665K)Sampling Ratio=100% (665K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 67.9 | |
| CNSbase_method=VCD2026.01 | 66.84 | |
| CoIDOSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 66.7 | |
| CNSbase_method=Vanilla2026.01 | 65.92 | |
| PreSelSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 65.6 | |
| ICONSSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 65.3 | |
| TypiClustSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 65.2 | |
| COINCIDESampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 64.9 | |
| Vanilla2026.01 | 64.8 | |
| VCD2026.01 | 63.28 | |
| XMASSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 62.4 | |
| IFDSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 62.3 | |
| CLIP-ScoreSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 61.3 | |
| Self-FilterSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 60.6 | |
| EL2NSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 59 | |
| RandomSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 58.8 |