General Vision-Language Understanding on MMB
84.6ScoreInternVL2.5
Evaluation Results
| Method | Links | |
|---|---|---|
| InternVL2.5LLM=InternLM2.5-7B, # Data=>6B / 50M / 4M, Model Scale=8B, Architecture Category=Modular, Reinforcement Learning=false2025.10 | 84.6 | |
| Encoder-BasedLLM=Qwen3-8B, # Data=>6B / 40M / 4M, Model Scale=8B, Architecture Category=Modular, Reinforcement Learning=false2025.10 | 84 | |
| Qwen2.5-VLLLM=Qwen2.5-7B, # Data=- / - / -, Model Scale=8B, Architecture Category=Modular, Reinforcement Learning=true2025.10 | 83.5 | |
| InternVL3LLM=Qwen2.5-7B, # Data=>6B / 100M / 22M, Model Scale=8B, Architecture Category=Modular, Reinforcement Learning=true2025.10 | 83.4 | |
| Qwen2-VLLLM=Qwen2-7B, # Data=- / - / -, Model Scale=8B, Architecture Category=Modular, Reinforcement Learning=false2025.10 | 83 | |
| NEOLLM=Qwen3-8B, # Data=345M / 40M / 4M, Model Scale=8B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 82.1 | |
| InternVL3LLM=Qwen2.5-1.5B, # Data=>6B / 100M / 22M, Model Scale=2B, Architecture Category=Modular, Reinforcement Learning=true2025.10 | 81.1 | |
| Qwen2.5-VLLLM=Qwen2.5-3B, # Data=- / - / -, Model Scale=2B, Architecture Category=Modular, Reinforcement Learning=true2025.10 | 79.1 | |
| NEOLLM=Qwen3-1.7B, # Data=345M / 40M / 4M, Model Scale=2B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 76 | |
| Encoder-BasedLLM=Qwen3-1.7B, # Data=>6B / 40M / 4M, Model Scale=2B, Architecture Category=Modular, Reinforcement Learning=false2025.10 | 75.8 | |
| Qwen2-VLLLM=Qwen2-1.5B, # Data=- / - / -, Model Scale=2B, Architecture Category=Modular, Reinforcement Learning=false2025.10 | 74.9 | |
| InternVL2.5LLM=InternLM2.5-1.8B, # Data=>6B / 100M / 16M, Model Scale=2B, Architecture Category=Modular, Reinforcement Learning=false2025.10 | 74.7 | |
| HoVLELLM=InternLM2-1.8B, # Data=550M / 50M / 7M, Model Scale=2B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 73.3 | |
| OneCATLLM=Qwen2.5-1.5B, # Data=436M / 70M / 13M, Model Scale=2B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 72.4 | |
| BREENLLM=Qwen2.5-7B, # Data=13M / 0M / 4M, Model Scale=8B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 71.4 | |
| SAILLLM=Mistral-7B, # Data=512M / 86M / 6M, Model Scale=8B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 70.1 | |
| SOLOLLM=Mistral-7B, # Data=44M / 0M / 2M, Model Scale=8B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 67.7 | |
| EVEv2LLM=Qwen2.5-7B, # Data=77M / 15M / 7M, Model Scale=8B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 66.3 | |
| Mono-InternVLLLM=InternLM2-1.8B, # Data=1.2B / 143M / 7M, Model Scale=2B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 65.5 | |
| Mono-InternVL-1.5LLM=InternLM2-1.8B, # Data=400M / 150M / 7M, Model Scale=2B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 64 | |
| VoRALLM=Qwen2.5-7B, # Data=30M / 0M / 0.6M, Model Scale=8B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 61.3 | |
| Emu3LLM=from scratch, # Data=- / - / -, Model Scale=8B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 58.5 | |
| EVELLM=Vicuna-7B, # Data=33M / 0M / 1.8M, Model Scale=8B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 52.3 | |
| ChameleonLLM=from scratch, # Data=1.4B / 0M / 1.8M, Model Scale=8B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 31.1 | |
| FuyuLLM=Persimmon-8B, # Data=- / - / -, Model Scale=8B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 10.7 |