Multimodal Mathematical Reasoning on WeMath mini (test)
79.5AccuracyQwen3-VL-4B-Instruct-Math-RL Teacher
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-VL-4B-Instruct-Math-RL TeacherN-Shot=02026.05 | 79.5 | |
| Claude-3.7-Sonnet#Data=/2025.06 | 72.6 | |
| Perception-R1-7B#Data=1.4K2025.06 | 72 | |
| Qwen2.5-VL-72B-IT#Data=/2025.06 | 71.9 | |
| GPT-4o#Data=/2025.06 | 68.8 | |
| OpenVLThinker-7B#Data=25K2025.06 | 66.3 | |
| VLAA-Thinker-7B#Data=25K2025.06 | 66.3 | |
| MM-Eureka-7B#Data=15K2025.06 | 65.6 | |
| Uni-OPDDistillation Setting=Single-Teacher, N-Shot=02026.05 | 65 | |
| SophiaVL-R1-7B#Data=130K2025.06 | 64.8 | |
| OPDDistillation Setting=Single-Teacher, N-Shot=02026.05 | 64.8 | |
| R1-OneVision-7B#Data=155K2025.06 | 61.9 | |
| Qwen2.5-VL-7B-IT#Data=/2025.06 | 61.4 | |
| Uni-OPDDistillation Setting=Multi-Teacher, N-Shot=02026.05 | 58.7 | |
| OPDDistillation Setting=Multi-Teacher, N-Shot=02026.05 | 57.6 | |
| InternVL2.5-8B#Data=/2025.06 | 53.5 | |
| Qwen3-VL-2B-Instruct StudentN-Shot=02026.05 | 48.6 | |
| Qwen2-VL-7B-IT#Data=/2025.06 | 42.3 |