Scientific Reasoning on GPQA (Acc, Tok)
62.6AccuracyGRPO+SOP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPO+SOPBackbone=Qwen3-8B2026.04 | 62.6 | 5,330 | |
| VanillaBackbone=Qwen3-8B2026.04 | 62.1 | 7,249 | |
| GRPO-λBackbone=Qwen3-8B2026.04 | 60.1 | 5,003 | |
| Step-GRPOBackbone=Qwen3-8B2026.04 | 56.1 | 5,560 | |
| GRPO+LPBackbone=Qwen3-8B2026.04 | 55.6 | 4,820 | |
| GRPO-8kBackbone=Qwen3-8B2026.04 | 55.1 | 5,085 | |
| VanillaBackbone=Qwen3-4B2026.04 | 55.1 | 6,644 | |
| GRPOBackbone=Qwen3-8B2026.04 | 54.6 | 6,087 | |
| Step-GRPOBackbone=Qwen3-4B2026.04 | 54 | 5,182 | |
| GRPOBackbone=Qwen3-4B2026.04 | 51 | 5,380 | |
| GRPO-8kBackbone=Qwen3-4B2026.04 | 50.5 | 4,571 | |
| GRPO+LPBackbone=Qwen3-4B2026.04 | 50 | 4,039 | |
| GRPO+SOPBackbone=Qwen3-4B2026.04 | 50 | 4,452 | |
| GRPO-λBackbone=Qwen3-4B2026.04 | 48 | 4,606 | |
| DEER+SFTBackbone=Qwen3-8B2026.04 | 47 | 8,860 | |
| GRPOBackbone=Qwen3-1.7B2026.04 | 39.4 | 6,037 | |
| GRPO-8kBackbone=Qwen3-1.7B2026.04 | 38.9 | 5,123 | |
| GRPO+LPBackbone=Qwen3-1.7B2026.04 | 38.9 | 4,691 | |
| DEER+SFTBackbone=Qwen3-4B2026.04 | 37.4 | 8,404 | |
| VanillaBackbone=Qwen3-1.7B2026.04 | 37.4 | 6,781 | |
| GRPO+SOPBackbone=Qwen3-1.7B2026.04 | 36.9 | 5,188 | |
| Step-GRPOBackbone=Qwen3-1.7B2026.04 | 34.9 | 5,356 | |
| GRPO-λBackbone=Qwen3-1.7B2026.04 | 34.3 | 4,899 | |
| DEER+SFTBackbone=Qwen3-1.7B2026.04 | 22.2 | 14,165 |