Visual Reasoning on HRBench-4K
91.38AccuracyS1-VL-32B-RL
Evaluation Results
| Method | Links | |
|---|---|---|
| S1-VL-32B-RLCategory=Thinking-with-Images Specialist Models, Parameters=32B, Training Stage=RL2026.04 | 91.38 | |
| S1-VL-32B-RL2026.06 | 91.38 | |
| Dynamo (Full)Model=Qwen3.5-27B, Evolution Strategy=Full2026.06 | 90.1 | |
| Dynamo (Tool Only)Model=Doubao-Seed-2.0, Evolution Strategy=Tool Only2026.06 | 90.05 | |
| Dynamo (Full)Model=Doubao-Seed-2.0, Evolution Strategy=Full2026.06 | 89.9 | |
| Dynamo (Tool Only)Model=Qwen3.5-27B, Evolution Strategy=Tool Only2026.06 | 89.86 | |
| S1-Omni-Image2026.06 | 88.38 | |
| Dynamo (Skill Only)Model=Qwen3.5-27B, Evolution Strategy=Skill Only2026.06 | 87.21 | |
| Dynamo (Skill Only)Model=Doubao-Seed-2.0, Evolution Strategy=Skill Only2026.06 | 86 | |
| Dynamo (Full)Model=o4-mini, Evolution Strategy=Full2026.06 | 85.71 | |
| Dynamo (Full)Model=GPT-5.4, Evolution Strategy=Full2026.06 | 85.38 | |
| S1-VL-32B-SFTCategory=Thinking-with-Images Specialist Models, Parameters=32B, Training Stage=SFT2026.04 | 85 | |
| S1-VL-32B-SFT2026.06 | 85 | |
| Gemini 2.5 ProCategory=Proprietary Models2026.04 | 83.9 | |
| Dynamo (Tool Only)Model=GPT-5.4, Evolution Strategy=Tool Only2026.06 | 83.67 | |
| Qwen3-VL-235B-A22B-ThinkingCategory=Open-Source Models, Parameters=235B-A22B2026.04 | 83 | |
| Qwen3-VL-235B-A22B-Thinking2026.06 | 83 | |
| Skywork-R1V4-30BCategory=Thinking-with-Images Specialist Models, Parameters=30B2026.04 | 82.8 | |
| Qwen3-VL-32B-ThinkingCategory=Open-Source Models, Parameters=32B2026.04 | 82.63 | |
| Qwen3-VL-32B-Thinking2026.06 | 82.63 | |
| Intern-S1 (235B+6B)Category=Open-Source Models, Parameters=235B+6B2026.04 | 82.5 | |
| Base AgentModel=Doubao-Seed-2.0, Evolution Strategy=None2026.06 | 82.14 | |
| Base AgentModel=Qwen3.5-27B, Evolution Strategy=None2026.06 | 81.71 | |
| Dynamo (Skill Only)Model=GPT-5.4, Evolution Strategy=Skill Only2026.06 | 78.05 | |
| Gemini 2.5 FlashCategory=Proprietary Models2026.04 | 77.5 | |
| Dynamo (Skill Only)Model=o4-mini, Evolution Strategy=Skill Only2026.06 | 77.24 | |
| Thyme-VL (7B)Category=Thinking-with-Images Specialist Models, Parameters=7B2026.04 | 77 | |
| Thyme-VL2026.06 | 77 | |
| Base AgentModel=GPT-5.4, Evolution Strategy=None2026.06 | 74.71 | |
| Dynamo (Tool Only)Model=o4-mini, Evolution Strategy=Tool Only2026.06 | 74.57 | |
| GPT-5Category=Proprietary Models2026.04 | 74.25 | |
| GPT-52026.06 | 74.25 | |
| Qwen2.5-VL-32BCategory=Open-Source Models, Parameters=32B2026.04 | 73.4 | |
| Base AgentModel=o4-mini, Evolution Strategy=None2026.06 | 73 | |
| InternVL3-8BCategory=Open-Source Models, Parameters=8B2026.04 | 70 | |
| Dynamo (Full)Model=GPT-4o, Evolution Strategy=Full2026.06 | 68.86 | |
| Qwen2.5-VL-7BCategory=Open-Source Models, Parameters=7B2026.04 | 68.8 | |
| Dynamo (Skill Only)Model=GPT-4o, Evolution Strategy=Skill Only2026.06 | 67.33 | |
| Dynamo (Tool Only)Model=GPT-4o, Evolution Strategy=Tool Only2026.06 | 64.52 | |
| Base AgentModel=GPT-4o, Evolution Strategy=None2026.06 | 63.86 | |
| Intern-S1-mini (8B)Category=Open-Source Models, Parameters=8B2026.04 | 62.13 |