Scientific Reasoning on GPQA-D (Acc, TR)
75.8AccuracyPUMA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PUMAModel=Qwen3-30B-A3B-Thinking2026.05 | 75.8 | 17.8 | |
| DEERModel=Qwen3-30B-A3B-Thinking2026.05 | 74.8 | -8.2 | |
| No-ThinkModel=Qwen3-30B-A3B-Thinking2026.05 | 73.7 | -11.5 | |
| Full CoTModel=Qwen3-30B-A3B-Thinking2026.05 | 72.7 | 0 | |
| CCoTModel=Qwen3-30B-A3B-Thinking2026.05 | 72.7 | 45.5 | |
| DynasorModel=Qwen3-30B-A3B-Thinking2026.05 | 67.7 | 32.2 | |
| CoDModel=Qwen3-30B-A3B-Thinking2026.05 | 65.2 | 28.8 | |
| Plan&BudgetModel=Qwen3-30B-A3B-Thinking2026.05 | 64.7 | 37.1 | |
| DEERModel=DeepSeek-R1-Distill-Qwen-7B2026.05 | 51.5 | -17.4 | |
| CoDModel=DeepSeek-R1-Distill-Qwen-7B2026.05 | 50.5 | 50.8 | |
| DEERModel=Llama-3.1-Nemotron-Nano-8B2026.05 | 49.5 | -313.2 | |
| Full CoTModel=DeepSeek-R1-Distill-Qwen-7B2026.05 | 49 | 0 | |
| PUMAModel=DeepSeek-R1-Distill-Qwen-7B2026.05 | 49 | 4 | |
| PUMAModel=Llama-3.1-Nemotron-Nano-8B2026.05 | 48.5 | 9.3 | |
| CCoTModel=DeepSeek-R1-Distill-Qwen-7B2026.05 | 48 | 55.6 | |
| Full CoTModel=Llama-3.1-Nemotron-Nano-8B2026.05 | 48 | 0 | |
| CoDModel=Llama-3.1-Nemotron-Nano-8B2026.05 | 45 | 31.9 | |
| DynasorModel=Llama-3.1-Nemotron-Nano-8B2026.05 | 45 | 1.5 | |
| CCoTModel=Llama-3.1-Nemotron-Nano-8B2026.05 | 43.9 | 31.1 | |
| Plan&BudgetModel=Llama-3.1-Nemotron-Nano-8B2026.05 | 40.9 | 26.7 | |
| DynasorModel=DeepSeek-R1-Distill-Qwen-7B2026.05 | 39.4 | 66.6 | |
| Plan&BudgetModel=DeepSeek-R1-Distill-Qwen-7B2026.05 | 38.4 | 36.2 | |
| Ans. Conv.Model=Qwen3-30B-A3B-Thinking2026.05 | 35.9 | 95.5 | |
| Ans. Conv.Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 34.3 | 92.4 | |
| No-ThinkModel=DeepSeek-R1-Distill-Qwen-7B2026.05 | 28.3 | 87.3 | |
| No-ThinkModel=Llama-3.1-Nemotron-Nano-8B2026.05 | 25.8 | -2.2 | |
| Ans. Conv.Model=Llama-3.1-Nemotron-Nano-8B2026.05 | 20.2 | 95.3 |