Multimodal Evaluation on MMBench en
54MMBench ScoreOFA
Evaluation Results
| Method | Links | |
|---|---|---|
| OFABackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 54 | |
| Full-DataBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=100%2026.05 | 53.4 | |
| CoIDOBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 51.4 | |
| ICONSBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 51.3 | |
| XMASBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 51.1 | |
| PreSelBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 50.4 | |
| COINCIDEBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 49.6 | |
| EL2NBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 44.7 | |
| RandomBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 43.6 | |
| Self-FilterBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 42.1 | |
| CLIP-ScoreBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 37.5 | |
| TypiClustBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 32.4 | |
| IFDBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 30.4 |