Frontier Multimodal Scientific Reasoning Combined 240-question (test)
56.66Accuracy (%)SciOrch
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SciOrchOrchestrator=Qwen3-VL-8B2026.06 | 56.66 | 10.42 | |
| Gemini-3-ProBase Model=Gemini-3-Pro, Evaluation Strategy=Consistency2026.06 | 53.33 | 14.36 | |
| Gemini-3-ProBase Model=Gemini-3-Pro, Evaluation Strategy=Debate2026.06 | 53.33 | 17.65 | |
| Gemini-3-ProBase Model=Gemini-3-Pro, Evaluation Strategy=Vanilla2026.06 | 52.92 | 5.97 | |
| GPT-5.4Base Model=GPT-5.4, Evaluation Strategy=Consistency2026.06 | 51.25 | 24.73 | |
| GPT-5.4Base Model=GPT-5.4, Evaluation Strategy=Vanilla2026.06 | 50.83 | 4.18 | |
| GPT-5.4Base Model=GPT-5.4, Evaluation Strategy=Debate2026.06 | 48.75 | 13.22 | |
| Claude-Sonnet-4.5Base Model=Claude-Sonnet-4.5, Evaluation Strategy=Consistency2026.06 | 46.25 | 19.33 | |
| Claude-Sonnet-4.5Base Model=Claude-Sonnet-4.5, Evaluation Strategy=Debate2026.06 | 45 | 21.72 | |
| Claude-Sonnet-4.5Base Model=Claude-Sonnet-4.5, Evaluation Strategy=Vanilla2026.06 | 38.33 | 3.14 | |
| P2LEvaluation Strategy=Routing-based2026.06 | 37.7 | 5.39 | |
| Qwen3-VL-8BBase Model=Qwen3-VL-8B, Evaluation Strategy=SFT2026.06 | 31.24 | — | |
| Qwen3-VL-8BBase Model=Qwen3-VL-8B, Evaluation Strategy=Consistency2026.06 | 30.83 | — | |
| Qwen3-VL-8BBase Model=Qwen3-VL-8B, Evaluation Strategy=Debate2026.06 | 30.42 | — | |
| Qwen3-VL-8BBase Model=Qwen3-VL-8B, Evaluation Strategy=GRPO2026.06 | 29.1 | — | |
| Qwen3-VL-8BBase Model=Qwen3-VL-8B, Evaluation Strategy=Vanilla2026.06 | 27.52 | — |