Multimodal long-horizon complex reasoning on LiveVQA
81.3ScoreClaude-4.6-Sonnet-Thinking
Evaluation Results
| Method | Links | |
|---|---|---|
| Claude-4.6-Sonnet-ThinkingSize=-, Train=-2026.06 | 81.3 | |
| REDSearcher-MM-SFTSize=30B, Train=Mid/SFT2026.06 | 78.5 | |
| Vision-DeepResearchSize=30B, Train=SFT/RL2026.06 | 77.6 | |
| GLM-5Size=744B, Train=-2026.06 | 77 | |
| Qwen3.5-397BSize=397B, Train=-2026.06 | 75.7 | |
| MiniMax-M2.7Size=230B, Train=-2026.06 | 69.7 | |
| MM-DeepResearchSize=32B, Train=SFT/RL2026.06 | 68 | |
| S1-DeepResearchSize=32B, Train=SFT2026.06 | 67.7 | |
| Gemini-3.1-Pro-PreviewSize=-, Train=-2026.06 | 66.7 | |
| GPT-5.2Size=-, Train=-2026.06 | 56.7 | |
| Kimi-K2.5Size=1T, Train=-2026.06 | 56.3 | |
| Qwen3-235BSize=235B, Train=-2026.06 | 52 | |
| Doubao-2.0-ProSize=-, Train=-2026.06 | 50.9 | |
| DeepSeek-V3.2Size=671B, Train=-2026.06 | 50.7 | |
| Qwen3-32BSize=32B, Train=-2026.06 | 50.3 |