Mathematical Reasoning on MathVerse Vision Only
67AccuracyBee-8B
Evaluation Results
| Method | Links | |
|---|---|---|
| Bee-8BOpenness=fully open, Model Size=8B, Training Strategy=RL2025.10 | 67 | |
| Bee-8BOpenness=fully open, Model Size=8B, Training Strategy=SFT2025.10 | 61.9 | |
| InternVL3.5Openness=semi-open, Model Size=8B2025.10 | 61.5 | |
| Keye-VLOpenness=semi-open, Model Size=8B2025.10 | 59.8 | |
| InternVL3.5-2BThinking Mode=true2025.12 | 53.4 | |
| MM-Eureka-Qwen-32BActivation Replay=true2025.11 | 52.4 | |
| Claude-3.5 SonnetActivation Replay=false2025.11 | 52 | |
| MM-Eureka-Qwen-32BActivation Replay=false2025.11 | 50.5 | |
| Perception-R1-7BBase Model Family=Qwen2.5-VL2025.06 | 50.1 | |
| VL-Rethinker-7BActivation Replay=true2025.11 | 49.2 | |
| QvQ-72B-PreviewActivation Replay=false2025.11 | 48.2 | |
| MM-Eureka-Qwen-7BActivation Replay=true2025.11 | 47.7 | |
| MM-Eureka-7BBase Model Family=Qwen2.5-VL2025.06 | 47.6 | |
| Qwen2.5-VL-7B-IT + GRPOBase Model Family=Qwen2.5-VL, Instruction-Tuning=IT, Training Strategy=GRPO2025.06 | 47.1 | |
| Vision-R1-7BBase Model Family=Qwen2.5-VL2025.06 | 47 | |
| VL-Rethinker-7BActivation Replay=false2025.11 | 47 | |
| VLAA-Thinker-7BBase Model Family=Qwen2.5-VL2025.06 | 45.7 | |
| MM-Eureka-Qwen-7BActivation Replay=false2025.11 | 45.1 | |
| V-ZeroBackbone=Qwen2.5-VL-7B-Instruct, Iteration=12026.01 | 43.9 | |
| Gemini-2.0-FlashActivation Replay=false2025.11 | 43.6 | |
| SophiaVL-R1-7BBase Model Family=Qwen2.5-VL2025.06 | 43.3 | |
| MMR1-Math-v0-7BActivation Replay=true2025.11 | 43.3 | |
| Qwen2.5-VLModel Size=7B2026.06 | 42.7 | |
| V-ZeroBackbone=Qwen2.5-VL-7B-Instruct, Iteration=22026.01 | 42.6 | |
| Qwen2.5-VL-7B-ITBase Model Family=Qwen2.5-VL, Instruction-Tuning=IT2025.06 | 42.2 | |
| Supervised GRPOBackbone=Qwen2.5-VL-7B-Instruct2026.01 | 42 | |
| R1-Onevision-7BBase Model Family=Qwen2.5-VL2025.06 | 41.9 | |
| Qwen2.5-VL-7BActivation Replay=false2025.11 | 41.1 | |
| MMR1-Math-v0-7BActivation Replay=false2025.11 | 41.1 | |
| GPT-4oActivation Replay=false2025.11 | 40.6 | |
| Qwen2.5-VL-7B-Instruct (Base)Backbone=Qwen2.5-VL-7B-Instruct2026.01 | 39.6 | |
| OpenVLThinker-7BBase Model Family=Qwen2.5-VL2025.06 | 39.5 | |
| Perception-R1-Qwen2-7BBase Model Family=Qwen2-VL2025.06 | 39.2 | |
| OpenVLThinker-7BBackbone=Qwen2.5-VL-7B-Instruct2026.01 | 36.8 | |
| R1-VL-7BBase Model Family=Qwen2-VL2025.06 | 36.8 | |
| SDAR-VLModel Size=8B2026.06 | 36.5 | |
| InternVL3.5-2BThinking Mode=false, Evaluation Framework=VLMEvalKit2025.12 | 35.3 | |
| Kimi-VL-16BActivation Replay=false2025.11 | 34.1 | |
| InternVL3-8BActivation Replay=false2025.11 | 33.9 | |
| V-ZeroBackbone=Qwen2.5-VL-3B-Instruct, Iteration=12026.01 | 33.4 | |
| V-ZeroBackbone=Qwen2.5-VL-3B-Instruct, Iteration=22026.01 | 32.6 | |
| Qwen2-VL-7B-IT + GRPOBase Model Family=Qwen2-VL, Instruction-Tuning=IT, Training Strategy=GRPO2025.06 | 32.4 | |
| Qwen2.5-VL-3B-Instruct (Base)Backbone=Qwen2.5-VL-3B-Instruct2026.01 | 32.1 | |
| Qwen2-VL-7B-ITBase Model Family=Qwen2-VL, Instruction-Tuning=IT2025.06 | 30.1 | |
| GPT-4o-miniActivation Replay=false2025.11 | 30 | |
| LaViDaModel Size=8B2026.06 | 27.2 | |
| LLaVA OneVisionOpenness=fully open, Model Size=7B2025.10 | 26.2 | |
| InternVL3-2B2025.12 | 25.3 | |
| PerceptionDLM-BaseModel Size=8B2026.06 | 25.3 | |
| Qwen2.5-VLOpenness=semi-open, Model Size=7B2025.10 | 25.1 | |
| jina-vlm2025.12 | 23.9 | |
| InternVL3Model Size=8B2026.06 | 23.1 | |
| Qwen3-VL-2BEvaluation Framework=VLMEvalKit2025.12 | 22.7 | |
| LLaDA-VModel Size=8B2026.06 | 20.6 | |
| LLaVA-OV-7BActivation Replay=false2025.11 | 17.6 | |
| Qwen2.5-VL-3BActivation Replay=false2025.11 | 17.5 | |
| Qwen2-VL-2BEvaluation Framework=VLMEvalKit2025.12 | 17.3 | |
| MolmoOpenness=fully open, Model Size=7B, Training Strategy=Distilled (-D)2025.10 | 4.2 |