Mathematical Reasoning on OpenMathReasoning (val)
0.597Pass@1 AccuracyGoldilocks
Evaluation Results
| Method | Links | |
|---|---|---|
| GoldilocksBackbone=Qwen3-4B, Training Protocol=Goldilocks, Teacher Model=Qwen3-1.7B2026.02 | 0.597 | |
| Qwen3-4B (GRPO)Backbone=Qwen3-4B, Training Protocol=GRPO, Teacher Model=Qwen3-1.7B2026.02 | 0.581 | |
| GoldilocksBackbone=Phi-4-4B-Instruct, Training Protocol=Goldilocks, Teacher Model=Qwen3-1.7B2026.02 | 0.41 | |
| Phi-4-4B-Instruct (GRPO)Backbone=Phi-4-4B-Instruct, Training Protocol=GRPO, Teacher Model=Qwen3-1.7B2026.02 | 0.371 | |
| GoldilocksBackbone=Qwen2.5-1.5B, Training Protocol=Goldilocks2026.02 | 0.334 | |
| Qwen2.5-1.5B (GRPO)Backbone=Qwen2.5-1.5B, Training Protocol=GRPO2026.02 | 0.306 | |
| Phi-4-4B-InstructBackbone=Phi-4-4B-Instruct, Training Protocol=Base Model (no RL), Teacher Model=Qwen3-1.7B2026.02 | 0.254 | |
| GoldilocksBackbone=Olmo2-1B, Training Protocol=Goldilocks2026.02 | 0.149 | |
| Qwen2.5-1.5BBackbone=Qwen2.5-1.5B, Training Protocol=Base Model (no RL)2026.02 | 0.1348 | |
| Qwen3-4BBackbone=Qwen3-4B, Training Protocol=Base Model (no RL), Teacher Model=Qwen3-1.7B2026.02 | 0.124 | |
| Olmo2-1B (GRPO)Backbone=Olmo2-1B, Training Protocol=GRPO2026.02 | 0.117 | |
| Olmo2-1BBackbone=Olmo2-1B, Training Protocol=Base Model (no RL)2026.02 | 0.025 |