Inference Runtime on GPQA Diamond (Scientific Reasoning)
1Total Inference Runtime (s)RL +length penalty
Evaluation Results
| Method | Links | |
|---|---|---|
| RL +length penaltyModel=DeepSeek-R1-Qwen-7B2026.04 | 1 | |
| S-GRPOModel=DeepSeek-R1-Qwen-7B2026.04 | 1 | |
| RL +length penaltyModel=DeepSeek-R1-Llama-8B2026.04 | 1 | |
| DASTModel=Qwen3-8B-Thinking2026.04 | 2 | |
| RL +length penaltyModel=Qwen3-8B-Thinking2026.04 | 2 | |
| S-GRPOModel=Qwen3-8B-Thinking2026.04 | 2 | |
| REDModel=Qwen3-8B-Thinking2026.04 | 2 | |
| DASTModel=DeepSeek-R1-Qwen-7B2026.04 | 2 | |
| REDModel=DeepSeek-R1-Qwen-7B2026.04 | 2 | |
| DASTModel=DeepSeek-R1-Llama-8B2026.04 | 2 | |
| S-GRPOModel=DeepSeek-R1-Llama-8B2026.04 | 2 | |
| REDModel=DeepSeek-R1-Llama-8B2026.04 | 2 | |
| Think or NotModel=Qwen3-32B-Thinking2026.04 | 3 | |
| REDModel=Qwen3-32B-Thinking2026.04 | 3 | |
| VanillaModel=Qwen3-8B-Thinking2026.04 | 4 | |
| Think or NotModel=Qwen3-8B-Thinking2026.04 | 4 | |
| DASTModel=Qwen3-32B-Thinking2026.04 | 4 | |
| VanillaModel=DeepSeek-R1-Qwen-7B2026.04 | 4 | |
| Think or NotModel=DeepSeek-R1-Qwen-7B2026.04 | 4 | |
| REDModel=DeepSeek-R1-Qwen-32B2026.04 | 4 | |
| VanillaModel=DeepSeek-R1-Llama-8B2026.04 | 4 | |
| Think or NotModel=DeepSeek-R1-Llama-8B2026.04 | 4 | |
| DASTModel=DeepSeek-R1-Qwen-32B2026.04 | 5 | |
| RL +length penaltyModel=DeepSeek-R1-Qwen-32B2026.04 | 5 | |
| S-GRPOModel=DeepSeek-R1-Qwen-32B2026.04 | 5 | |
| VanillaModel=Qwen3-32B-Thinking2026.04 | 6 | |
| RL +length penaltyModel=Qwen3-32B-Thinking2026.04 | 6 | |
| S-GRPOModel=Qwen3-32B-Thinking2026.04 | 6 | |
| REDModel=DeepSeek-R1-Llama-70B2026.04 | 6 | |
| VanillaModel=DeepSeek-R1-Qwen-32B2026.04 | 7 | |
| Think or NotModel=DeepSeek-R1-Qwen-32B2026.04 | 8 | |
| DASTModel=DeepSeek-R1-Llama-70B2026.04 | 8 | |
| RL +length penaltyModel=DeepSeek-R1-Llama-70B2026.04 | 8 | |
| S-GRPOModel=DeepSeek-R1-Llama-70B2026.04 | 8 | |
| VanillaModel=DeepSeek-R1-Llama-70B2026.04 | 10 | |
| Think or NotModel=DeepSeek-R1-Llama-70B2026.04 | 11 |