Multimodal Reasoning on SLAKE
90.62AccuracyDS-RL + GTP
Evaluation Results
| Method | Links | |
|---|---|---|
| DS-RL + GTPModel=Lingshu, Scale=32B2026.06 | 90.62 | |
| GTPModel=Lingshu, Scale=32B2026.06 | 90.38 | |
| DS-RLModel=Lingshu, Scale=32B2026.06 | 90.14 | |
| VISTA-SFTBackbone=InternVL3-8B2026.05 | 87.61 | |
| R3VBackbone=InternVL3-8B2026.05 | 87.04 | |
| STaR+Backbone=InternVL3-8B2026.05 | 86.76 | |
| SFT-OracleBackbone=InternVL3-8B2026.05 | 86.1 | |
| STaRBackbone=InternVL3-8B2026.05 | 85.92 | |
| Instruct ModelModel=Lingshu, Scale=32B2026.06 | 85.82 | |
| DS-RL + GTPModel=Lingshu, Scale=7B2026.06 | 84.62 | |
| SFT-SeedBackbone=InternVL3-8B2026.05 | 84.51 | |
| VISTA-SFTBackbone=InternVL3-2B2026.05 | 82.54 | |
| DS-RLModel=Lingshu, Scale=7B2026.06 | 82.45 | |
| VISTA-SFTBackbone=Qwen3-VL-2B-Instruct2026.05 | 81.97 | |
| SFT-OracleBackbone=InternVL3-2B2026.05 | 81.97 | |
| R3VBackbone=Qwen3-VL-2B-Instruct2026.05 | 81.69 | |
| GTPModel=Lingshu, Scale=7B2026.06 | 81.49 | |
| STaR+Backbone=InternVL3-2B2026.05 | 81.41 | |
| Instruct ModelModel=Lingshu, Scale=7B2026.06 | 81.25 | |
| SFT-OracleBackbone=Qwen3-VL-2B-Instruct2026.05 | 80.28 | |
| R3VBackbone=InternVL3-2B2026.05 | 80 | |
| STaR+Backbone=Qwen3-VL-2B-Instruct2026.05 | 78.87 | |
| DS-RL + GTPModel=HuatuoGPT-Vision, Scale=7B2026.06 | 78.61 | |
| DS-RLModel=HuatuoGPT-Vision, Scale=7B2026.06 | 75.48 | |
| STaRBackbone=Qwen3-VL-2B-Instruct2026.05 | 75.21 | |
| GTPModel=HuatuoGPT-Vision, Scale=7B2026.06 | 74.52 | |
| STaRBackbone=InternVL3-2B2026.05 | 71.55 | |
| SFT-SeedBackbone=InternVL3-2B2026.05 | 71.54 | |
| Instruct ModelModel=HuatuoGPT-Vision, Scale=7B2026.06 | 70.91 | |
| SFT-SeedBackbone=Qwen3-VL-2B-Instruct2026.05 | 69.86 |