Scientific Reasoning on GPQA-D (Acc, Len, CR)
61.6AccuracyDEER
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DEERBackbone=Qwen3-8B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 61.6 | 9 | 90.9 | |
| ETRBackbone=Qwen3-8B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 57.1 | 5.2 | 52.5 | |
| O1-PrunerBackbone=Qwen3-8B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 56.1 | 4.1 | 41.4 | |
| PEARBackbone=Qwen3-8B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 55.1 | 8.2 | 83.3 | |
| LCPOBackbone=Qwen3-8B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 54.6 | 4 | 44.4 | |
| PEARBackbone=Qwen3-4B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 54.54 | 7.1 | 31.7 | |
| ETRBackbone=Qwen3-4B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 53.5 | 4.1 | 39.4 | |
| DEERBackbone=Qwen3-4B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 52.5 | 8.2 | 78.8 | |
| OriginalBackbone=Qwen3-8B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 52 | 9.9 | 100 | |
| O1-PrunerBackbone=Qwen3-4B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 50 | 3.3 | 31.7 | |
| LCPOBackbone=Qwen3-4B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 47.5 | 3.8 | 36.3 | |
| OriginalBackbone=Qwen3-4B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 43.9 | 10.4 | 100 | |
| O1-PrunerBackbone=DeepSeek-R1-Distill-7B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 39.4 | 6.2 | 54.9 | |
| ETRBackbone=DeepSeek-R1-Distill-7B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 37.3 | 2.5 | 22.1 | |
| PEARBackbone=DeepSeek-R1-Distill-7B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 36.9 | 5.2 | 45.9 | |
| NoThinkBackbone=Qwen3-8B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 26.8 | 4.4 | 44.4 | |
| OriginalBackbone=DeepSeek-R1-Distill-7B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 24.2 | 11.3 | 100 | |
| NoThinkBackbone=Qwen3-4B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 23.2 | 4.7 | 45.2 | |
| DEERBackbone=DeepSeek-R1-Distill-7B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 22.7 | 7.6 | 67.3 | |
| NoThinkBackbone=DeepSeek-R1-Distill-7B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 22.2 | 2 | 17.7 | |
| LCPOBackbone=DeepSeek-R1-Distill-7B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 11.6 | 2.8 | 24.6 |