Lemma Judging on DeepTheorem sampled perturbation (test)
90.9Exact Match AccuracyLlama-3.1 (RULES)
Evaluation Results
| Method | Links | |
|---|---|---|
| Llama-3.1 (RULES)Optimization=RULES2026.02 | 90.9 | |
| Llama-3.1 (vanilla)Optimization=vanilla2026.02 | 89.2 | |
| Qwen2.5 (RULES)Optimization=RULES2026.02 | 87.8 | |
| Qwen2.5 (GRPO)Optimization=GRPO2026.02 | 81.2 | |
| Llama-3.1 (GRPO)Optimization=GRPO2026.02 | 80.9 | |
| Qwen2.5 (vanilla)Optimization=vanilla2026.02 | 71.9 | |
| OLMO2 (RULES)Optimization=RULES2026.02 | 60.5 | |
| OLMO2 (vanilla)Optimization=vanilla2026.02 | 47.6 | |
| DeepMath (RULES)Optimization=RULES2026.02 | 47 | |
| OLMO2 (GRPO)Optimization=GRPO2026.02 | 46.8 | |
| DeepMath (GRPO)Optimization=GRPO2026.02 | 35.6 | |
| DeepMath (vanilla)Optimization=vanilla2026.02 | 24 |