Multimodal Mathematical Reasoning on Aggregate Math Benchmarks
87.47Overall Macro ScoreQwen3.5-397B-A17B*
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3.5-397B-A17B*Model Type=Open-source LMM2026.05 | 87.47 | |
| Gemini-3-Pro*Model Type=Closed-source LMM2026.05 | 79.51 | |
| GPT-5*Model Type=Closed-source LMM2026.05 | 76.55 | |
| Doubao-Seed-1.8*Model Type=Closed-source LMM2026.05 | 73.42 | |
| Qwen3VL-8B-instruct + GeoSym HardBase Model=Qwen3-VL, Scale=8B2026.05 | 63.18 | |
| Qwen3VL-8B-instruct + GeoSym EntryBase Model=Qwen3-VL, Scale=8B2026.05 | 62.49 |