Scientific Reasoning on SCIENTIFIC
82.8AccuracyDEER
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DEERBackbone=Qwen3-235B-Thinking, Reasoning Strategy=DEER2026.03 | 82.8 | 9,005 | |
| Vanilla CoTBackbone=Qwen3-235B-Thinking, Reasoning Strategy=Vanilla CoT2026.03 | 80.8 | 8,893 | |
| RPDI-EEBackbone=Qwen3-235B-Thinking, Reasoning Strategy=RPDI-EE2026.03 | 80.3 | 8,910 | |
| RPDI-EEBackbone=Qwen3-30B-A3B-Thinking-2507, Reasoning Strategy=RPDI-EE2026.03 | 77.8 | 7,393 | |
| Vanilla CoTBackbone=Qwen3-30B-A3B-Thinking-2507, Reasoning Strategy=Vanilla CoT2026.03 | 74.8 | 7,394 | |
| ThinkLessBackbone=Qwen3-30B-A3B-Thinking-2507, Reasoning Strategy=ThinkLess2026.03 | 74.8 | 6,841 | |
| DEERBackbone=Qwen3-30B-A3B-Thinking-2507, Reasoning Strategy=DEER2026.03 | 74.8 | 7,167 | |
| NoThinkingBackbone=Qwen3-30B-A3B-Thinking-2507, Reasoning Strategy=NoThinking2026.03 | 71.2 | 6,267 | |
| RPDI-EEBackbone=DeepSeek-R1-Distill-Qwen-32B, Reasoning Strategy=RPDI-EE2026.03 | 64.7 | 6,972 | |
| RPDI-EEBackbone=DeepSeek-R1-Distill-Llama-70B, Reasoning Strategy=RPDI-EE2026.03 | 64.7 | 5,940 | |
| DEERBackbone=DeepSeek-R1-Distill-Llama-70B, Reasoning Strategy=DEER2026.03 | 62.1 | 5,659 | |
| Vanilla CoTBackbone=DeepSeek-R1-Distill-Llama-70B, Reasoning Strategy=Vanilla CoT2026.03 | 60.1 | 5,538 | |
| Dynasor-CoTBackbone=Qwen3-30B-A3B-Thinking-2507, Reasoning Strategy=Dynasor-CoT2026.03 | 59.1 | 1,735 | |
| Dynasor-CoTBackbone=DeepSeek-R1-Distill-Qwen-32B, Reasoning Strategy=Dynasor-CoT2026.03 | 57.6 | 1,655 | |
| RPDI-EEBackbone=DeepSeek-R1-Distill-Qwen-14B, Reasoning Strategy=RPDI-EE2026.03 | 56.1 | 6,575 | |
| Vanilla CoTBackbone=DeepSeek-R1-Distill-Qwen-32B, Reasoning Strategy=Vanilla CoT2026.03 | 56.1 | 7,386 | |
| ThinkLessBackbone=DeepSeek-R1-Distill-Qwen-32B, Reasoning Strategy=ThinkLess2026.03 | 53.5 | 4,365 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-14B, Reasoning Strategy=DEER2026.03 | 52 | 6,575 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-32B, Reasoning Strategy=DEER2026.03 | 52 | 7,134 | |
| NoThinkingBackbone=DeepSeek-R1-Distill-Qwen-32B, Reasoning Strategy=NoThinking2026.03 | 51 | 2,249 | |
| Vanilla CoTBackbone=DeepSeek-R1-Distill-Qwen-14B, Reasoning Strategy=Vanilla CoT2026.03 | 50.5 | 6,963 | |
| Dynasor-CoTBackbone=DeepSeek-R1-Distill-Qwen-14B, Reasoning Strategy=Dynasor-CoT2026.03 | 48.5 | 1,686 | |
| Dynasor-CoTBackbone=DeepSeek-R1-Distill-Qwen-7B, Reasoning Strategy=Dynasor-CoT2026.03 | 45.5 | 1,876 | |
| NoThinkingBackbone=DeepSeek-R1-Distill-Qwen-14B, Reasoning Strategy=NoThinking2026.03 | 44.4 | 1,309 | |
| ThinkLessBackbone=DeepSeek-R1-Distill-Qwen-14B, Reasoning Strategy=ThinkLess2026.03 | 34.9 | 1,748 | |
| DEERBackbone=DeepSeek-R1-Distill-Llama-8B, Reasoning Strategy=DEER2026.03 | 34.3 | 9,515 | |
| Vanilla CoTBackbone=DeepSeek-R1-Distill-Qwen-7B, Reasoning Strategy=Vanilla CoT2026.03 | 32.3 | 10,319 | |
| ThinkLessBackbone=DeepSeek-R1-Distill-Qwen-7B, Reasoning Strategy=ThinkLess2026.03 | 31.8 | 1,175 | |
| NoThinkingBackbone=DeepSeek-R1-Distill-Qwen-7B, Reasoning Strategy=NoThinking2026.03 | 31.3 | 841 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-7B, Reasoning Strategy=DEER2026.03 | 28.3 | 9,433 | |
| RPDI-EEBackbone=DeepSeek-R1-Distill-Llama-8B, Reasoning Strategy=RPDI-EE2026.03 | 25.3 | 9,769 | |
| RPDI-EEBackbone=DeepSeek-R1-Distill-Qwen-7B, Reasoning Strategy=RPDI-EE2026.03 | 24.8 | 9,727 | |
| Vanilla CoTBackbone=DeepSeek-R1-Distill-Llama-8B, Reasoning Strategy=Vanilla CoT2026.03 | 21.2 | 9,604 | |
| RPDI-EEBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Reasoning Strategy=RPDI-EE2026.03 | 8.1 | 12,823 | |
| Vanilla CoTBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Reasoning Strategy=Vanilla CoT2026.03 | 6.1 | 13,386 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Reasoning Strategy=DEER2026.03 | 4.6 | 12,685 |