Mathematical Reasoning on MATH (test) (Accuracy + Time)
78.51AccuracyLatent-GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Latent-GRPOModel Scale=Qwen3-1.7B2026.01 | 78.51 | 811.51 | |
| Latent-GRPOModel Scale=Qwen3-4B2026.01 | 77.53 | 1,081.47 | |
| LLM-as-JudgeModel Scale=Qwen3-4B2026.01 | 77.44 | 2,357.31 | |
| LLM-as-JudgeModel Scale=Qwen3-1.7B2026.01 | 65.77 | 1,608.34 | |
| Rule-basedModel Scale=Qwen3-4B2026.01 | 62.63 | 1,084.72 | |
| Latent-GRPOModel Scale=Qwen3-0.6B2026.01 | 58.47 | 718.63 | |
| Rule-basedModel Scale=Qwen3-0.6B2026.01 | 55.63 | 723.12 | |
| LLM-as-JudgeModel Scale=Qwen3-0.6B2026.01 | 52.94 | 1,224.15 | |
| Rule-basedModel Scale=Qwen3-1.7B2026.01 | 42.14 | 814.22 | |
| STPBase model=LLaDA-8B-Instruct2026.02 | 36.2 | 98,537 | |
| GRPO w/ ELBOBase model=LLaDA-8B-Instruct2026.02 | 34.2 | 126,045 | |
| LLaDA-8B-InstructBase model=LLaDA-8B-Instruct2026.02 | 32.8 | — | |
| Diffu-GRPOBase model=LLaDA-8B-Instruct2026.02 | 32.8 | 113,358 |