Multimodal Scientific Reasoning on Frontier Multimodal Scientific Reasoning SGI (test)
49.3AccuracySciOrch
Evaluation Results
| Method | Links | |
|---|---|---|
| SciOrchOrchestrator=Qwen3-VL-8B2026.06 | 49.3 | |
| Gemini-3-ProBase Model=Gemini-3-Pro, Evaluation Strategy=Vanilla2026.06 | 46.58 | |
| Gemini-3-ProBase Model=Gemini-3-Pro, Evaluation Strategy=Consistency2026.06 | 45.89 | |
| Gemini-3-ProBase Model=Gemini-3-Pro, Evaluation Strategy=Debate2026.06 | 45.89 | |
| GPT-5.4Base Model=GPT-5.4, Evaluation Strategy=Consistency2026.06 | 45.21 | |
| GPT-5.4Base Model=GPT-5.4, Evaluation Strategy=Vanilla2026.06 | 40.41 | |
| Claude-Sonnet-4.5Base Model=Claude-Sonnet-4.5, Evaluation Strategy=Debate2026.06 | 40.41 | |
| GPT-5.4Base Model=GPT-5.4, Evaluation Strategy=Debate2026.06 | 39.73 | |
| Claude-Sonnet-4.5Base Model=Claude-Sonnet-4.5, Evaluation Strategy=Consistency2026.06 | 39.04 | |
| P2LEvaluation Strategy=Routing-based2026.06 | 32.17 | |
| Claude-Sonnet-4.5Base Model=Claude-Sonnet-4.5, Evaluation Strategy=Vanilla2026.06 | 31.51 | |
| Qwen3-VL-8BBase Model=Qwen3-VL-8B, Evaluation Strategy=SFT2026.06 | 26 | |
| Qwen3-VL-8BBase Model=Qwen3-VL-8B, Evaluation Strategy=Vanilla2026.06 | 24.7 | |
| Qwen3-VL-8BBase Model=Qwen3-VL-8B, Evaluation Strategy=Consistency2026.06 | 22.6 | |
| Qwen3-VL-8BBase Model=Qwen3-VL-8B, Evaluation Strategy=Debate2026.06 | 21.23 | |
| Qwen3-VL-8BBase Model=Qwen3-VL-8B, Evaluation Strategy=GRPO2026.06 | 19.6 |