Multimodal Logical Reasoning on LogicVista
77AccuracyQwen3.5-27B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3.5-27BMode=REASONING, Architecture=Dense, # Total Params=27B, # Activated Params=27B2026.04 | 77 | — | |
| EXAONE 4.5 33BMode=REASONING, Architecture=Dense, # Total Params=33B, # Activated Params=33B2026.04 | 73.8 | — | |
| Qwen3-VL-235B-A22BMode=Thinking, Architecture=MoE, # Total Params=236B, # Activated Params=23B2026.04 | 72.2 | — | |
| Qwen3-VL-32BMode=Thinking, Architecture=Dense, # Total Params=33B, # Activated Params=33B2026.04 | 70.9 | — | |
| GPT-5 miniMode=REASONING: HIGH, Architecture=-, # Total Params=-, # Activated Params=-2026.04 | 70.3 | — | |
| ChatGPT-4o-latestParam (B)=-2025.09 | 64.4 | — | |
| GPT-4oModel Category=Proprietary Models2025.06 | 64.4 | — | |
| GPT-4.1-20250414Param (B)=-2025.09 | 61.1 | — | |
| Qwen2.5VL-72B x Qwen3-32BParam (B)=1042025.09 | 60.6 | — | |
| QVQ-72B-PreviewParam (B)=722025.09 | 58.2 | — | |
| Claude3.7-SonnetParam (B)=-2025.09 | 58.2 | — | |
| Claude-3.7-SonnetModel Category=Proprietary Models2025.06 | 58.2 | — | |
| InternVL3.5-8BModel Scale=8B, Optimization Method=N/A2026.06 | 57.3 | — | |
| Qwen2.5VL-7B x Qwen3-32BParam (B)=392025.09 | 56.6 | — | |
| MetisModel Category=Agentic Multimodal Models2026.04 | 56.2 | — | |
| InternVL3-78BParam (B)=782025.09 | 55.9 | — | |
| Qwen2.5-VL-72BParam (B)=722025.09 | 55.7 | — | |
| Qwen2.5-VL-72BModel Category=Open-source Models (>70B)2025.06 | 55.7 | — | |
| Qwen3-VL-8B-InstructModel Category=Open-source Models2026.04 | 54.9 | — | |
| GLM-4v-Plus-20250111Param (B)=-2025.09 | 54.4 | — | |
| InternVL3.5-4B (+GNDPO)Model Scale=4B, Optimization Method=GNDPO2026.06 | 54.4 | — | |
| InternVL3.5-4B (+OPD)Model Scale=4B, Optimization Method=OPD2026.06 | 53.9 | — | |
| InternVL3.5-4B (Base (Instruct))Model Scale=4B, Optimization Method=Base (Instruct)2026.06 | 53.5 | — | |
| InternVL3.5-4B (+GSPO)Model Scale=4B, Optimization Method=GSPO2026.06 | 53.5 | — | |
| Gemini-2.0-ProModel Category=Proprietary Models2025.06 | 53.2 | — | |
| GPT-4oParam (B)=-2025.09 | 52.8 | — | |
| InternVL3.5-8BParam (B)=82025.09 | 52.6 | — | |
| Qwen3-VL-4B-Instruct-Logic-RL TeacherN-Shot=02026.05 | 52.5 | 73.8 | |
| Athena-7BModel Category=Open-source Models (~7B)2025.06 | 51.3 | — | |
| GPT-4oTool=Code, Param Size=-2025.11 | 51.2 | — | |
| Qwen2.5VL-7B x Qwen3-4BParam (B)=112025.09 | 50.8 | — | |
| InternVL2.5-78B-MPOModel Category=Open-source Models (>70B)2025.06 | 50.8 | — | |
| ThymeTool=Code, Param Size=7B2025.11 | 49 | — | |
| ThymeModel Category=Agentic Multimodal Models2026.04 | 49 | — | |
| InternVL2.5-78BModel Category=Open-source Models (>70B)2025.06 | 49 | — | |
| DeepEyesV2Tool=General, Param Size=7B2025.11 | 48.7 | — | |
| DeepEyesV2Model Category=Agentic Multimodal Models2026.04 | 48.7 | — | |
| Keye-VL-8BParam (B)=82025.09 | 48.6 | — | |
| VLAA-Thinker-7BParam (B)=72025.09 | 48.5 | — | |
| Qwen2.5-VL-7BParam (B)=72025.09 | 47.9 | — | |
| Qwen2.5-VL-7BModel Category=Open-source Models (~7B)2025.06 | 47.9 | — | |
| DeepEyesTool=Crop, Param Size=7B2025.11 | 47.7 | — | |
| DeepEyesModel Category=Agentic Multimodal Models2026.04 | 47.7 | — | |
| MM-EurekaTool=✗, Param Size=7B2025.11 | 46.3 | — | |
| MM-Eureka-7BModel Category=Text-only Reasoning Models2026.04 | 46.3 | — | |
| Qwen-2.5-VLTool=✗, Param Size=7B2025.11 | 45.9 | — | |
| VLAA-ThinkerTool=✗, Param Size=7B2025.11 | 45.9 | — | |
| Qwen-2.5-VL-7B-InstructModel Category=Open-source Models2026.04 | 45.9 | — | |
| VLAA-Thinker-7BModel Category=Text-only Reasoning Models2026.04 | 45.9 | — | |
| SAIL-VL2-8BParam (B)=82025.09 | 45 | — | |
| OpenVLThinker-7BParam (B)=72025.09 | 44.5 | — | |
| InternVL3Tool=✗, Param Size=8B2025.11 | 44.1 | — | |
| InternVL3-8BModel Category=Open-source Models2026.04 | 44.1 | — | |
| ThinkLiteTool=✗, Param Size=7B2025.11 | 42.7 | — | |
| VL-RethinkerTool=✗, Param Size=7B2025.11 | 42.7 | — | |
| ThinkLite-VL-7BModel Category=Text-only Reasoning Models2026.04 | 42.7 | — | |
| VL-Rethinker-7BModel Category=Text-only Reasoning Models2026.04 | 42.7 | — | |
| Uni-OPDDistillation Setting=Multi-Teacher, N-Shot=02026.05 | 42 | 69.8 | |
| InternVL3.5-2B (+GNDPO)Model Scale=2B, Optimization Method=GNDPO2026.06 | 41.6 | — | |
| InternVL3.5-2B (Base (Instruct))Model Scale=2B, Optimization Method=Base (Instruct)2026.06 | 41.2 | — | |
| VLM-R1-3B-MathParam (B)=32025.09 | 40.5 | — | |
| InternVL3.5-2B (+GSPO)Model Scale=2B, Optimization Method=GSPO2026.06 | 39.6 | — | |
| InternVL3.5-2B (+OPD)Model Scale=2B, Optimization Method=OPD2026.06 | 39.6 | — | |
| OPDDistillation Setting=Multi-Teacher, N-Shot=02026.05 | 38 | 65.2 | |
| Uni-OPDDistillation Setting=Single-Teacher, N-Shot=02026.05 | 36.8 | 65.2 | |
| MiniCPM-o-2.6-8BModel Category=Open-source Models (~7B)2025.06 | 36 | — | |
| OPDDistillation Setting=Single-Teacher, N-Shot=02026.05 | 35.3 | 61.6 | |
| InternVL2.5-8BModel Category=Open-source Models (~7B)2025.06 | 33.6 | — | |
| LLaVA-OVTool=✗, Param Size=7B2025.11 | 33.3 | — | |
| LLaVA-OneVisionModel Category=Open-source Models2026.04 | 33.3 | — | |
| Qwen3-VL-2B-Instruct StudentN-Shot=02026.05 | 32.4 | 59.1 | |
| InternVL3.5-1B (+GNDPO)Model Scale=1B, Optimization Method=GNDPO2026.06 | 31.3 | — | |
| InternVL3.5-1B (+OPD)Model Scale=1B, Optimization Method=OPD2026.06 | 30.9 | — | |
| InternVL3.5-1B (Base (Instruct))Model Scale=1B, Optimization Method=Base (Instruct)2026.06 | 29.1 | — | |
| Qwen2.5-VL-3BParam (B)=32025.09 | 28.2 | — | |
| InternVL3.5-1B (+GSPO)Model Scale=1B, Optimization Method=GSPO2026.06 | 26.6 | — |