Multimodal Perception Evaluation on MME-P
1,687Perception ScoreBAGEL
Evaluation Results
| Method | Links | |
|---|---|---|
| BAGEL#Params=7B+7B2026.03 | 1,687 | |
| InternVL-U#Params=2B+1.7B2026.03 | 1,607.5 | |
| Qwen2.5-VL#Params=3B2026.03 | 1,574.9 | |
| MetaQuery-L#Params=3B+1B2026.03 | 1,574.3 | |
| InternVL3.5#Params=2B2026.03 | 1,552.1 | |
| LLaVA-1.5V#Params=7B2026.03 | 1,510.7 | |
| Ovis-U1#Params=2.4B+1.2B2026.03 | 1,508 | |
| OFABackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 1,499.3 | |
| XMASSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 1,485.7 | |
| Full-Data(665K)Sampling Ratio=100% (665K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 1,476.9 | |
| TUNA#Params=1.5B2026.03 | 1,461.5 | |
| PreSelSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 1,457.7 | |
| VisNecSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 1,457.2 | |
| Show-o2#Params=1.5B2026.03 | 1,450.9 | |
| Janus-Pro#Params=1.5B2026.03 | 1,444 | |
| ICONSSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 1,435.6 | |
| CoIDOSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 1,419.5 | |
| COINCIDESampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 1,414.9 | |
| EL2NSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 1,405.2 | |
| RandomSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 1,397.5 | |
| TypiClustSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 1,396.2 | |
| CLIP-ScoreSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 1,380.3 | |
| Self-FilterSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 1,356.5 | |
| JanusFlow#Params=1.3B2026.03 | 1,333.1 | |
| IFDSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 1,307.2 | |
| CoIDOBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 1,298.8 | |
| Self-FilterBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 1,262.2 | |
| EL2NBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 1,253.8 | |
| ICONSBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 1,252.5 | |
| RandomBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 1,238.6 | |
| Full-DataBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=100%2026.05 | 1,238.1 | |
| PreSelBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 1,218.8 | |
| IFDBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 1,210.9 | |
| TypiClustBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 1,194.1 | |
| COINCIDEBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 1,184.4 | |
| XMASBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 1,151.2 | |
| CLIP-ScoreBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 1,058 |