Multimodal Perception Assessment on MME Perception
1,702.17MME-PQwen2-VL-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2-VL-7BBackbone=Qwen2-VL-7B2026.04 | 1,702.17 | |
| HalluVL-DPOBackbone=Qwen2-VL-7B2026.04 | 1,696.96 | |
| AD-Loop#Params=7B, Capabilities=Und. and Gen.2026.02 | 1,696 | |
| HalluVL-DPOwBackbone=Qwen2-VL-7B2026.04 | 1,691.17 | |
| BAGEL#Params=7B, Capabilities=Und. and Gen.2026.02 | 1,687 | |
| VCDBackbone=Qwen2-VL-7B2026.04 | 1,682.13 | |
| CoVFTBackbone=LLaVA-1.5-13B2026.03 | 1,590.6 | |
| ShareGPT4V# Params=7B, Resolution=3362025.03 | 1,567.4 | |
| Janus-Pro#Params=7B, Capabilities=Und. and Gen.2026.02 | 1,567.1 | |
| FreezeBackbone=LLaVA-1.5-13B2026.03 | 1,557.6 | |
| Full fine-tuningBackbone=LLaVA-1.5-13B2026.03 | 1,555.4 | |
| BitFitBackbone=LLaVA-1.5-13B2026.03 | 1,552.8 | |
| LLaVA-1.5Backbone=LLaVA-1.5-13B2026.03 | 1,531.3 | |
| CoVFTBackbone=LLaVA-1.5-7B2026.03 | 1,525.2 | |
| SemHiTok# Params=7B, Resolution=3842025.03 | 1,512.8 | |
| LLaVA-v1.5# Params=7B, Resolution=3362025.03 | 1,510.7 | |
| LLaVA-v1.5#Params=7B, Capabilities=Und. Only2026.02 | 1,510.7 | |
| LLaVA-1.5Backbone=LLaVA-1.5-7B2026.03 | 1,510.7 | |
| Full fine-tuningBackbone=LLaVA-1.5-7B2026.03 | 1,510.2 | |
| VisNecBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 1,505.5 | |
| BitFitBackbone=LLaVA-1.5-7B2026.03 | 1,496.8 | |
| LoRABackbone=LLaVA-1.5-7B2026.03 | 1,494.5 | |
| LLaVA-1.5-7BBackbone=LLaVA-1.5-7B2026.04 | 1,493.23 | |
| TokLIP# Params=7B, Resolution=3842025.03 | 1,488.4 | |
| Qwen-Vl-Chat# Params=7B, Resolution=4482025.03 | 1,487.5 | |
| Qwen-VL-Chat#Params=7B, Capabilities=Und. Only2026.02 | 1,487.5 | |
| XMASSampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 1,485.7 | |
| Full-DataSampling Ratio=100% (665K), Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 1,476.9 | |
| FreezeBackbone=LLaVA-1.5-7B2026.03 | 1,473.7 | |
| PreSelSampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 1,457.7 | |
| VPTBackbone=LLaVA-1.5-7B2026.03 | 1,452.1 | |
| SemHiTok# Params=7B, Resolution=2562025.03 | 1,449 | |
| Liquid#Params=8B, Capabilities=Und. and Gen.2026.02 | 1,448 | |
| Janus-Pro-1B# Params=1.5B, Resolution=3842025.03 | 1,444 | |
| OFASampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 1,443.4 | |
| ICONSSampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 1,435.6 | |
| SVPTBackbone=LLaVA-1.5-7B2026.03 | 1,431.7 | |
| AntidoteBackbone=LLaVA-1.5-7B, Hyperparameter Configuration=HP-orig2026.04 | 1,422.77 | |
| CoIDOSampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 1,419.5 | |
| COINCIDESampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 1,414.9 | |
| MMaDA#Params=8B, Capabilities=Und. and Gen.2026.02 | 1,410.7 | |
| EL2NSampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 1,405.2 | |
| VILA-U# Params=7B, Resolution=3842025.03 | 1,401.8 | |
| RandomSampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 1,397.5 | |
| TypiClustSampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 1,396.2 | |
| VCDBackbone=LLaVA-1.5-7B2026.04 | 1,389.79 | |
| SynerGen-VL# Params=2.4B, Resolution=5122025.03 | 1,381 | |
| CLIP-ScoreSampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 1,380.3 | |
| TokenFlow-L# Params=13B, Resolution=2562025.03 | 1,365.4 | |
| HalluVL-DPOBackbone=LLaVA-1.5-7B2026.04 | 1,359.95 | |
| Self-FilterSampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 1,356.5 | |
| TokenFlow-B# Params=13B, Resolution=2242025.03 | 1,353.6 | |
| Janus# Params=1.5B, Resolution=3842025.03 | 1,338 | |
| VILA-U# Params=7B, Resolution=2562025.03 | 1,336.2 | |
| LLaVA-Phi# Params=2.7B, Resolution=2562025.03 | 1,335.1 | |
| HalluVL-DPOwBackbone=LLaVA-1.5-7B2026.04 | 1,314.8 | |
| IFDSampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 1,307.2 | |
| CoIDOBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 1,298.8 | |
| Self-FilterBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 1,262.2 | |
| EL2NBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 1,253.8 | |
| ICONSBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 1,252.5 | |
| Emu3#Params=8B, Capabilities=Und. and Gen.2026.02 | 1,244 | |
| EMU3# Params=8B, Resolution=5122025.03 | 1,243.8 | |
| RandomBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 1,238.6 | |
| Full-Data(186K)Backbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=100%2026.03 | 1,238.1 | |
| AntidoteBackbone=LLaVA-1.5-7B, Hyperparameter Configuration=HP-search2026.04 | 1,220.05 | |
| PreSelBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 1,218.8 | |
| InstructBLIP#Params=13B, Capabilities=Und. Only2026.02 | 1,212.8 | |
| IFDBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 1,210.9 | |
| TypiClustBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 1,194.1 | |
| COINCIDEBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 1,184.4 | |
| MAR# Params=1.5B, Resolution=5122025.03 | 1,155 | |
| XMASBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 1,151.2 | |
| Liquid# Params=7B, Resolution=5122025.03 | 1,119.3 | |
| Show-o# Params=1.5B, Resolution=2562025.03 | 1,097.2 | |
| Show-o#Params=1.3B, Capabilities=Und. and Gen.2026.02 | 1,097.2 | |
| CLIP-ScoreBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 1,058 |