Scientific Reasoning on GPQA-D (Acc, ΔTok)
68.2AccuracyNoWait
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| NoWaitBase Model=Qwen3-4B-Thinking2025.10 | 68.2 | -19.6 | |
| DEERBase Model=Qwen3-4B-Thinking2025.10 | 68.2 | -1.3 | |
| THINKBRAKEBase Model=Phi-4-Reasoning2025.10 | 67.7 | -1.1 | |
| THINKBRAKEBase Model=Qwen3-32B2025.10 | 65.7 | -19.9 | |
| Qwen3-32BStrategy=Baseline2025.10 | 65.2 | — | |
| Qwen3-4B-ThinkingStrategy=Baseline2025.10 | 64.1 | — | |
| NoWaitBase Model=Phi-4-Reasoning2025.10 | 63.1 | -19.1 | |
| Dynasor-CoTBase Model=Qwen3-4B-Thinking2025.10 | 62.6 | -22.6 | |
| THINKBRAKEBase Model=Qwen3-4B-Thinking2025.10 | 62.6 | -32.7 | |
| Phi-4-ReasoningStrategy=Baseline2025.10 | 62.6 | — | |
| NoWaitBase Model=Qwen3-14B2025.10 | 62.1 | -20.5 | |
| THINKBRAKEBase Model=Qwen3-14B2025.10 | 61.1 | -39.9 | |
| Qwen3-14BStrategy=Baseline2025.10 | 60.6 | — | |
| NoWaitBase Model=Qwen3-32B2025.10 | 60.1 | -12.4 | |
| NoWaitBase Model=Qwen3-4B2025.10 | 57.6 | -26.6 | |
| THINKBRAKEBase Model=Qwen3-4B2025.10 | 55.6 | -29.7 | |
| Qwen3-4BStrategy=Baseline2025.10 | 51 | — | |
| ThinkLessBase Model=Qwen3-4B-Thinking2025.10 | 50 | -100 | |
| DeepSeek-R1-7BStrategy=Baseline2025.10 | 48 | — | |
| THINKBRAKE-pBase Model=Qwen3-4B-Thinking2025.10 | 47 | -67.5 | |
| THINKBRAKEBase Model=DeepSeek-R1-7B2025.10 | 45.5 | -51.2 | |
| NoWaitBase Model=DeepSeek-R1-7B2025.10 | 43.4 | -35.5 |