Mathematical Reasoning on Average (GSM8K, MATH500, AIME24, OlymBench)
64AccuracyInfoDensity
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| InfoDensityBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.03 | 64 | 6,443 | |
| GRPO-AccBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.03 | 63.9 | 7,248 | |
| OriginalBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.03 | 61.5 | 9,217 | |
| DSBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.03 | 61.2 | 7,906 | |
| PEARBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.03 | 61.1 | 6,136 | |
| GRPO-LPBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.03 | 60.9 | 7,436 | |
| GRPO-AccBackbone=Qwen3-0.6B2026.03 | 51.9 | 8,819 | |
| PEARBackbone=Qwen3-0.6B2026.03 | 50.2 | 6,811 | |
| OriginalBackbone=Qwen3-0.6B2026.03 | 49.5 | 8,291 | |
| InfoDensityBackbone=Qwen3-0.6B2026.03 | 49.2 | 6,014 | |
| DSBackbone=Qwen3-0.6B2026.03 | 49 | 6,832 | |
| GRPO-LPBackbone=Qwen3-0.6B2026.03 | 48.3 | 6,956 |