Autoformalization on PutnamBench
0.561Mean Cycle ConsistencyRL (GRPO) 2B
Evaluation Results
| Method | Links | |
|---|---|---|
| RL (GRPO) 2BModel Scale=2B, Training Strategy=RL (GRPO)2026.03 | 0.561 | |
| SFT Curriculum 9BModel Scale=9B, Training Strategy=SFT Curriculum2026.03 | 0.548 | |
| SFT No-Curriculum 2BModel Scale=2B, Training Strategy=SFT No-Curriculum2026.03 | 0.432 | |
| SFT Curriculum 2BModel Scale=2B, Training Strategy=SFT Curriculum2026.03 | 0.422 | |
| Base 2BModel Scale=2B, Evaluation Protocol=few-shot2026.03 | 0.034 | |
| Base 9BModel Scale=9B, Evaluation Protocol=few-shot2026.03 | 0.004 |