Science Question Answering on FrontierScience
70.5AccuracyQwen3.5-397B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3.5-397BBase Model=Qwen3.5-397B2026.05 | 70.5 | |
| Qwen3.5-122BBase Model=Qwen3.5-122B2026.05 | 59.8 | |
| Kimi-K2.5Base Model=Kimi-K2.52026.05 | 55.2 | |
| Qwen3.5-35BBase Model=Qwen3.5-35B2026.05 | 54.3 | |
| Deepseek-V3.2Base Model=Deepseek-V3.22026.05 | 54.2 | |
| Qwen3.5-9B + MaRBase Model=Qwen3.5-9B, Optimization Method=MaR2026.05 | 50 | |
| Qwen3.5-9BBase Model=Qwen3.5-9B2026.05 | 42.4 | |
| Qwen3.5-9B + DAPOBase Model=Qwen3.5-9B, Optimization Method=DAPO2026.05 | 39 | |
| GLM-5.1Base Model=GLM-5.12026.05 | 38.2 | |
| ARYAPrompting Strategy=Zero-shot prompting, Parameters=02026.03 | 37.5 | |
| Qwen3.5-4BBase Model=Qwen3.5-4B2026.05 | 34.7 | |
| GPT-OSS-120BBase Model=GPT-OSS-120B2026.05 | 34.4 | |
| Qwen3.5-4B + MaRBase Model=Qwen3.5-4B, Optimization Method=MaR2026.05 | 34 | |
| Qwen3.5-4B + DAPOBase Model=Qwen3.5-4B, Optimization Method=DAPO2026.05 | 33 | |
| GPT-5.2Prompting Strategy=Optimized prompting / few-shot / CoT2026.03 | 25.8 | |
| GPT-5.2 (pub)Context=Best Published Baseline2026.03 | 25.8 | |
| Claude Opus 4.6Prompting Strategy=Zero-shot prompting2026.03 | 8.8 | |
| GPT-5.2Prompting Strategy=Zero-shot prompting2026.03 | 7.5 |