Multimodal Understanding on Multiple Datasets Aggregate
79.09Average ScoreUniFlow-XL
Evaluation Results
| Method | Links | |
|---|---|---|
| UniFlow-XLVision Encoder=InternViT-300M, LLM Backbone=Qwen2.5-7B, Resolution=4482025.10 | 79.09 | |
| TokenFlow-XLVision Encoder=SigLIP-SO400M, LLM Backbone=Qwen2.5-14B, Resolution=3842025.10 | 73.04 | |
| UniFlow-LVVision Encoder=InternViT-300M, LLM Backbone=Vicuna-7B, Resolution=448, Training Setting=LLaVA-v1.5 setting2025.10 | 69.04 | |
| UniFlow-LVVision Encoder=SigLIP2-SO400M, LLM Backbone=Vicuna-7B, Resolution=256, Training Setting=LLaVA-v1.5 setting2025.10 | 67.87 | |
| UniFlow-LVVision Encoder=DFN-CLIP-L, LLM Backbone=Vicuna-7B, Resolution=224, Training Setting=LLaVA-v1.5 setting2025.10 | 65.02 | |
| TokenFlow-LVision Encoder=ViTamin-XL, LLM Backbone=Vicuna-13B, Resolution=256, Training Setting=LLaVA-v1.5 setting2025.10 | 62.4 | |
| Mobile-O-0.5BType=Und. and Gen. ≤ 2B, # Total Params=1.6B2026.02 | 62.1 | |
| FastVLM-0.5BType=Und. Only ≤ 1B, # Total Params=0.6B2026.02 | 60.5 | |
| TokenFlow-BVision Encoder=CLIP-B, LLM Backbone=Vicuna-13B, Resolution=224, Training Setting=LLaVA-v1.5 setting2025.10 | 60.21 | |
| EMU3-8BType=Und. and Gen. > 2B, # Total Params=9.0B2026.02 | 59.4 | |
| UniFlow-LVVision Encoder=DINOv2-L, LLM Backbone=Vicuna-7B, Resolution=378, Training Setting=LLaVA-v1.5 setting2025.10 | 58.92 | |
| JanusFlowType=Und. and Gen. ≤ 2B, # Total Params=2.1B2026.02 | 57 | |
| JanusType=Und. and Gen. ≤ 2B, # Total Params=2.1B2026.02 | 54 | |
| Show-o-Clip-ViTType=Und. and Gen. ≤ 2B, # Total Params=1.6B2026.02 | 46.8 |