Multimodal Math Reasoning on WeMath
98.7Accuracyo1
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| o12026.03 | 98.7 | — | |
| o1Model Category=Closed-Source Models2026.03 | 98.7 | — | |
| Qwen3.5-27BMode=REASONING, Architecture=Dense, # Total Params=27B, # Activated Params=27B2026.04 | 84 | — | |
| MM-Eureka-32B-R-TAPModel Category=Open-Source Reasoning Models2026.03 | 79.3 | — | |
| EXAONE 4.5 33BMode=REASONING, Architecture=Dense, # Total Params=33B, # Activated Params=33B2026.04 | 79.1 | — | |
| Qwen2.5-VL-7B-Instruct + R-TAPModel Size=7B2026.03 | 78.2 | — | |
| Gemini-2.5-Pro-ThinkingAccess Type=Closed-Source2025.12 | 78 | — | |
| Seed-1.5-thinkingAccess Type=Closed-Source2025.12 | 78 | — | |
| Gemini-2.5-ProModel Category=Close-source Models2025.09 | 78 | — | |
| Qwen3-VL-235B-A22BMode=Thinking, Architecture=MoE, # Total Params=236B, # Activated Params=23B2026.04 | 74.8 | — | |
| CEPOBackbone=Qwen3-VL-4B-Instruct2026.05 | 74.77 | — | |
| BaseBackbone=Qwen3-VL-4B-Instruct2026.05 | 74.31 | — | |
| SDPOBackbone=Qwen3-VL-4B-Instruct2026.05 | 73.62 | — | |
| MM-Eureka-32BModel Category=Open-Source Reasoning Models2026.03 | 73.4 | — | |
| RLSDBackbone=Qwen3-VL-4B-Instruct2026.05 | 73.28 | — | |
| GRPOBackbone=Qwen3-VL-4B-Instruct2026.05 | 73.1 | — | |
| ToR-DAPOData Size=39K (ViRL-39K), Base Model=Qwen-2.5-VL-7B2026.03 | 73 | — | |
| Claude3.7-Sonnet2026.03 | 72.6 | — | |
| Claude3.7-SonnetModel Category=Closed-Source Models2026.03 | 72.6 | — | |
| Qwen-2.5-VL-72B2026.03 | 72.4 | — | |
| Qwen-2.5-VL-72BModel Category=Open-Source General Models2026.03 | 72.4 | — | |
| OPSDBackbone=Qwen3-VL-4B-Instruct2026.05 | 72.36 | — | |
| ToR-DAPOData Size=2.1K (Geo3K), Base Model=Qwen-2.5-VL-7B2026.03 | 72.1 | — | |
| Qwen2.5-VL-7B-Instruct + NoisyRolloutModel Size=7B2026.03 | 71.9 | — | |
| Qwen3-VL-32BMode=Thinking, Architecture=Dense, # Total Params=33B, # Activated Params=33B2026.04 | 71.6 | — | |
| Gemini2-flash2026.03 | 71.4 | — | |
| Gemini-2-flashModel Category=Closed-Source Models2026.03 | 71.4 | — | |
| GPT-5-ThinkingModel Category=Close-source Models2025.09 | 71.1 | — | |
| MM-Eureka-7B-R-TAPModel Category=Open-Source Reasoning Models2026.03 | 71 | — | |
| GPT-5 miniMode=REASONING: HIGH, Architecture=-, # Total Params=-, # Activated Params=-2026.04 | 70.3 | — | |
| NoisyRollout-7BData Size=2.1K, Base Model=Qwen-2.5-VL-7B2026.03 | 69.6 | — | |
| DIVA-GRPO-7B2026.03 | 69.3 | — | |
| DAPOData Size=2.1K (Geo3K), Base Model=Qwen-2.5-VL-7B2026.03 | 69.3 | — | |
| ThinkLite-7B-VLModel Size=7B2026.03 | 69.2 | — | |
| ThinkLite-7B-VLData Size=11K, Base Model=Qwen-2.5-VL-7B2026.03 | 69.2 | — | |
| Qwen-2.5-VL-32B2026.03 | 69.1 | — | |
| Qwen-2.5-VL-32BModel Category=Open-Source General Models2026.03 | 69.1 | — | |
| ToR-GRPOData Size=2.1K (Geo3K), Base Model=Qwen-2.5-VL-7B2026.03 | 68.9 | — | |
| GPT-4o2026.03 | 68.8 | — | |
| GPT-4oModel Category=Closed-Source Models2026.03 | 68.8 | — | |
| Qwen2.5-VL-7B-Instruct + Vanilla GRPOModel Size=7B2026.03 | 68.6 | — | |
| R1-ShareVL-7B2026.03 | 67.9 | — | |
| VLAA-Thinker-Qwen2.5-7BModel Size=7B2026.03 | 67.9 | — | |
| VLAA-Thinker-7BData Size=25K, Base Model=Qwen-2.5-VL-7B2026.03 | 67.9 | — | |
| OpenVLThinker-7BModel Size=7B2026.03 | 67.8 | — | |
| OpenVLThinker-7BData Size=35K+15K, Base Model=Qwen-2.5-VL-7B2026.03 | 67.8 | — | |
| InternVL2.5-VL-38B2026.03 | 67.5 | — | |
| InternVL2.5-VL-38BModel Category=Open-Source General Models2026.03 | 67.5 | — | |
| GRPOData Size=2.1K (Geo3K), Base Model=Qwen-2.5-VL-7B2026.03 | 67.4 | — | |
| ADORA-7BModel Size=7B2026.03 | 67.1 | — | |
| InternVL2.5-VL-78B2026.03 | 66.3 | — | |
| InternVL2.5-VL-78BModel Category=Open-Source General Models2026.03 | 66.3 | — | |
| InternVL2.5-38B-MPO2026.03 | 66.2 | — | |
| InternVL2.5-38B-MPOModel Category=Open-Source Reasoning Models2026.03 | 66.2 | — | |
| MM-Eureka-7B2026.03 | 66.1 | — | |
| MM-Eureka-7BModel Category=Open-Source Reasoning Models2026.03 | 66.1 | — | |
| MM-Eureka-Qwen-7BModel Size=7B2026.03 | 65.5 | — | |
| MM-Eureka-Qwen-7BData Size=15K, Base Model=Qwen-2.5-VL-7B2026.03 | 65.5 | — | |
| QVQ-72B-Preview2026.03 | 65.4 | — | |
| QVQ-72B-PreviewModel Category=Open-Source Reasoning Models2026.03 | 65.4 | — | |
| MetisModel Category=Agentic Multimodal Models2026.04 | 65.2 | — | |
| OpenVLThinker-7B2026.03 | 64.3 | — | |
| OpenVLThinker-7BModel Category=Open-Source Reasoning Models2026.03 | 64.3 | — | |
| Adora-7B2026.03 | 64.2 | — | |
| ADORA-7BModel Category=Open-Source Reasoning Models2026.03 | 64.2 | — | |
| Qwen2.5-VL-7B-InstructModel Size=7B2026.03 | 63.1 | — | |
| Qwen2.5-VL-7B-InstructData Size=-, Base Model=Open-source Models2026.03 | 63.1 | — | |
| Claude-4-SonnetAccess Type=Closed-Source2025.12 | 63 | — | |
| ToR-DAPOData Size=39K (ViRL-39K), Base Model=Qwen-2.5-VL-3B2026.03 | 62.4 | — | |
| Qwen-2.5-VL-7B2026.03 | 62.1 | — | |
| Qwen-2.5-VL-7BModel Category=Open-Source General Models2026.03 | 62.1 | — | |
| R1-OneVision-7BModel Size=7B2026.03 | 62.1 | — | |
| R1-OneVision-7BData Size=155K+10K, Base Model=Qwen-2.5-VL-7B2026.03 | 62.1 | — | |
| R1-Onevision-7B2026.03 | 61.8 | — | |
| R1-Onevision-7BModel Category=Open-Source Reasoning Models2026.03 | 61.8 | — | |
| ToR-DAPOData Size=2.1K (Geo3K), Base Model=Qwen-2.5-VL-3B2026.03 | 59.6 | — | |
| DAPOData Size=2.1K (Geo3K), Base Model=Qwen-2.5-VL-3B2026.03 | 57.8 | — | |
| SFT-7B2026.03 | 57.6 | — | |
| InternVL3.5-8BModel Scale=8B, Optimization Method=N/A2026.06 | 57 | — | |
| Gemini-2.0-ProModel Category=Proprietary Models2025.06 | 56.5 | — | |
| CEPOBackbone=Qwen3-VL-2B-Instruct2026.05 | 56.21 | — | |
| GPT-4.1Access Type=Closed-Source2025.12 | 55.5 | — | |
| GPT-4.1-20250414Param (B)=-2025.09 | 55.5 | — | |
| RLSDBackbone=Qwen3-VL-2B-Instruct2026.05 | 55.26 | — | |
| GRPOBackbone=Qwen3-VL-2B-Instruct2026.05 | 54.6 | — | |
| OursAccess Type=Open-Source, Model Scale=7B2025.12 | 54.4 | — | |
| InternVL2.5-VL-8B2026.03 | 53.5 | — | |
| InternVL2.5-8B-MPO2026.03 | 53.5 | — | |
| InternVL2.5-VL-8BModel Category=Open-Source General Models2026.03 | 53.5 | — | |
| InternVL2.5-8B-MPOModel Category=Open-Source Reasoning Models2026.03 | 53.5 | — | |
| BaseBackbone=Qwen3-VL-2B-Instruct2026.05 | 52.24 | — | |
| Qwen2.5VL-72B x Qwen3-32BParam (B)=1042025.09 | 51.8 | — | |
| ChatGPT-4o-latestParam (B)=-2025.09 | 50.6 | — | |
| GPT-4oModel Category=Proprietary Models2025.06 | 50.6 | — | |
| Claude3.7-SonnetParam (B)=-2025.09 | 49.3 | — | |
| Claude-3.7-SonnetModel Category=Proprietary Models2025.06 | 49.3 | — | |
| Qwen2.5-VL-72BParam (B)=722025.09 | 49.1 | — | |
| Qwen2.5-VL-72BModel Category=Open-source Models (>70B)2025.06 | 49.1 | — | |
| InternVL3.5-4B (+GNDPO)Model Scale=4B, Optimization Method=GNDPO2026.06 | 48.8 | — | |
| MathBookAccess Type=Open-Source, Model Scale=7B2025.12 | 48.4 | — |