General Visual Question Answering on MMStar
77.8ScoreSeed 1.5-VL
Evaluation Results
| Method | Links | |
|---|---|---|
| Seed 1.5-VLthinking=true, decoding=greedy2025.05 | 77.8 | |
| Gemini 1.5 Prothinking=true, decoding=greedy2025.05 | 77.5 | |
| Gemini 2.5 Pro2026.04 | 77.5 | |
| Seed 1.5-VLthinking=false, decoding=greedy2025.05 | 76.2 | |
| Keye-VLOpenness=semi-open, Model Size=8B2025.10 | 75.5 | |
| OpenVLThinkerV2Parameters=8B2026.04 | 73.8 | |
| Qwen3-VL GRPORL Strategy=GRPO2026.04 | 71.7 | |
| Qwen3-VL GDPORL Strategy=GDPO2026.04 | 71.5 | |
| Bee-8BOpenness=fully open, Model Size=8B, Training Strategy=RL2025.10 | 71.4 | |
| Qwen2.5-VLNumber of Parameters=72B2025.02 | 70.8 | |
| Qwen 2.5-VL 72Bthinking=false, decoding=greedy2025.05 | 70.8 | |
| OneThinker-8BParameters=8B2026.04 | 70.6 | |
| InternVL2.5Number of Parameters=78B2025.02 | 69.5 | |
| InternVL3.5Openness=semi-open, Model Size=8B2025.10 | 69.3 | |
| Bee-8BOpenness=fully open, Model Size=8B, Training Strategy=SFT2025.10 | 69 | |
| Claude 3.7 Sonnetthinking=true, decoding=sampling2025.05 | 68.8 | |
| Qwen3-VL-Instruct-8BParameters=8B2026.04 | 68.5 | |
| Qwen2-VLNumber of Parameters=72B2025.02 | 68.3 | |
| CPOModel=Qwen3-VL-4B2026.07 | 67.73 | |
| OpenAI o1thinking=true, decoding=greedy2025.05 | 67.5 | |
| VisionZero2026.04 | 65.8 | |
| ARES-7BParameters=7B2026.04 | 65.3 | |
| Claude-3.5 Sonnet-0620Model Version=06202025.02 | 65.1 | |
| GPT-4othinking=false, decoding=greedy2025.05 | 65.1 | |
| GPT-4o2026.04 | 65.1 | |
| GPT-4o 0513Model Version=05132025.02 | 64.7 | |
| MM-Eureka-7BParameters=7B2026.04 | 64.4 | |
| Qwen2.5-VLNumber of Parameters=7B2025.02 | 63.9 | |
| Qwen2.5-VLOpenness=semi-open, Model Size=7B2025.10 | 63.9 | |
| GRPOModel=Qwen3-VL-4B2026.07 | 63.2 | |
| Vision-G12026.04 | 63.1 | |
| VL-Rethinker-7BParameters=7B2026.04 | 62.7 | |
| OVR-7BParameters=7B2026.04 | 62.7 | |
| LoRAModel=Qwen3-VL-4B2026.07 | 61.93 | |
| LLaVA OneVisionOpenness=fully open, Model Size=7B2025.10 | 61.7 | |
| OpenVLThinker-7BParameters=7B2026.04 | 59.1 | |
| BaseModel=Qwen3-VL-4B2026.07 | 58.93 | |
| AVLM-2BModel Scale=2B2026.06 | 57.1 | |
| MolmoOpenness=fully open, Model Size=7B, Training Strategy=Distilled (-D)2025.10 | 56.1 | |
| Qwen2.5-VLNumber of Parameters=3B2025.02 | 55.9 | |
| FFTModel=Qwen3-VL-4B2026.07 | 55.27 | |
| Qwen2.5-Omni-3BModel Scale=3B2026.06 | 53.82 | |
| GRPOFine-tuning setting=GRPO, Backbone=Qwen3-VL-2B2026.07 | 53.47 | |
| LoRAFine-tuning setting=LoRA, Backbone=Qwen3-VL-2B2026.07 | 53.27 | |
| CPOFine-tuning setting=CPO, Backbone=Qwen3-VL-2B2026.07 | 53.13 | |
| BaseFine-tuning setting=Base, Backbone=Qwen3-VL-2B2026.07 | 52.8 | |
| GSPOModel=Qwen3-VL-4B2026.07 | 51.2 | |
| GSPOFine-tuning setting=GSPO, Backbone=Qwen3-VL-2B2026.07 | 50.53 | |
| FFTFine-tuning setting=FFT, Backbone=Qwen3-VL-2B2026.07 | 48.6 | |
| Gemma-4-E2B-itModel Scale=4B2026.06 | 28.85 |