Reasoning on MATH (Accuracy, Latency, Speedup)
92.84Accuracy (%)LR
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LRTarget Model=Qwen / Qwen3-8B, Draft Model=Qwen / Qwen3-0.6B-Base2026.03 | 92.84 | 9.56 | 1.2 | |
| Target ModelTarget Model=Qwen / Qwen3-8B2026.03 | 91.54 | 1 | 1 | |
| Online-LRTarget Model=Qwen / Qwen3-8B, Draft Model=Qwen / Qwen3-0.6B-Base, framework=OnlineSPEC2026.03 | 91.37 | 10.63 | 1.24 | |
| OSD-LRTarget Model=Qwen / Qwen3-8B, Draft Model=Qwen / Qwen3-0.6B-Base2026.03 | 89.87 | 6.21 | 1.1 | |
| Draft ModelDraft Model=Qwen / Qwen3-0.6B-Base2026.03 | 60.66 | 1 | 3.54 | |
| Rubric-grounded GRPOCheckpoint=Best by held-out rubric reward, Backbone=Llama-3.1-8B-Instruct2026.05 | 52.88 | — | — | |
| Llama-3.1-8B-InstructCheckpoint=Base2026.05 | 50.06 | — | — |