Scientific Reasoning on GPQA Diamond (Mean@32, Pass@16, Pass@32)
47.16Mean@32N-GRPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| N-GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 47.16 | 88.77 | 92.8 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 47 | 87.15 | 91.42 | |
| GRPO + Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 46.78 | 87.57 | 92.29 | |
| Base ModelBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 46.59 | 86.55 | 90.73 | |
| Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 45.99 | 86.96 | 91.28 | |
| N-GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 33.68 | 87.58 | 92.87 | |
| GRPO + Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 33.19 | 86.89 | 91.92 | |
| Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 32.86 | 86.31 | 91.73 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 32.24 | 86.25 | 91.95 | |
| Base ModelBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 32.23 | 85.51 | 90.79 |