Scientific Question Answering on GPQA (Accuracy & Response Length)
9,032Avg Response LengthQwen3-4B-Thinking
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-4B-ThinkingMethod Category=Base Model, Thinking Strategy=Long-CoT2026.01 | 9,032 | 67.7 | |
| AIMMethod Category=Data-dependent Merging2026.01 | 8,007 | 70.7 | |
| Average MergingMethod Category=Data-free Merging2026.01 | 7,680 | 64.7 | |
| RPAMMethod Category=Data-dependent Merging2026.01 | 7,612 | 66.7 | |
| CoDMethod Category=Prompt-guided2026.01 | 6,733 | 65.2 | |
| TIES MergingMethod Category=Data-free Merging2026.01 | 6,598 | 63.6 | |
| DARE-LinearMethod Category=Data-free Merging2026.01 | 6,404 | 58.6 | |
| Ada-R1Method Category=Training-based2026.01 | 6,395 | 65.7 | |
| Task ArithmeticMethod Category=Data-free Merging2026.01 | 6,191 | 62.1 | |
| ACMMethod Category=Data-dependent Merging2026.01 | 6,141 | 61.6 | |
| Qwen3-4B-InstructMethod Category=Base Model, Thinking Strategy=Short-CoT2026.01 | 5,086 | 54.5 | |
| Llama 3.1 8B + EAGLE3Model=Llama 3.1 8B, Decoding Method=SGLang + EAGLE3, Steps=7, Top-k=1, Draft Length=8, Normalization=Post-norm2026.05 | 4.78 | — | |
| Llama 3.1 8B + EAGLE3Model=Llama 3.1 8B, Decoding Method=SGLang + EAGLE3, Steps=7, Top-k=1, Draft Length=8, Normalization=Pre-norm2026.05 | 4.74 | — |