Mathematical Reasoning on MinervaMath (held-out)
49.7AccuracyAntiSD
Evaluation Results
| Method | Links | |
|---|---|---|
| AntiSDBackbone=Qwen3-30B-A3B, Training Condition=+AntiSD, Speedup=2.9×, Peak-mean step=140, Sampling strategy=avg@42026.05 | 49.7 | |
| AntiSDBackbone=Qwen3-8B, Training Condition=+AntiSD, Speedup=5.0×, Peak-mean step=180, Sampling strategy=avg@42026.05 | 48.5 | |
| GRPOBackbone=Qwen3-30B-A3B, Training Condition=+GRPO, Speedup=1.0×, Peak-mean step=150, Sampling strategy=avg@42026.05 | 47.1 | |
| AntiSDBackbone=Qwen3-4B-IT-2507, Training Condition=+AntiSD, Speedup=10.0×, Peak-mean step=100, Sampling strategy=avg@42026.05 | 46.4 | |
| GRPOBackbone=Olmo3-7B-TK, Training Condition=+GRPO, Speedup=1.0×, Peak-mean step=80, Sampling strategy=avg@42026.05 | 46.4 | |
| AntiSDBackbone=Olmo3-7B-TK, Training Condition=+AntiSD, Speedup=2.0×, Peak-mean step=40, Sampling strategy=avg@42026.05 | 45.8 | |
| Olmo3-7B-TKBackbone=Olmo3-7B-TK, Training Condition=Base, Sampling strategy=avg@42026.05 | 45.2 | |
| GRPOBackbone=Qwen3-8B, Training Condition=+GRPO, Speedup=1.0×, Peak-mean step=200, Sampling strategy=avg@42026.05 | 45.1 | |
| SDBackbone=Olmo3-7B-TK, Training Condition=+SD, Peak-mean step=40, Sampling strategy=avg@42026.05 | 44.8 | |
| SDBackbone=Qwen3-30B-A3B, Training Condition=+SD, Peak-mean step=60, Sampling strategy=avg@42026.05 | 44.1 | |
| Qwen3-30B-A3BBackbone=Qwen3-30B-A3B, Training Condition=Base, Sampling strategy=avg@42026.05 | 43.5 | |
| Qwen3-4B-IT-2507Backbone=Qwen3-4B-IT-2507, Training Condition=Base, Sampling strategy=avg@42026.05 | 43.4 | |
| SDBackbone=Qwen3-4B-IT-2507, Training Condition=+SD, Peak-mean step=10, Sampling strategy=avg@42026.05 | 43 | |
| AntiSDBackbone=Olmo3-7B-IT, Training Condition=+AntiSD, Speedup=9.5×, Peak-mean step=200, Sampling strategy=avg@42026.05 | 42.4 | |
| SDBackbone=Qwen3-8B, Training Condition=+SD, Peak-mean step=200, Sampling strategy=avg@42026.05 | 40.7 | |
| Qwen3-8BBackbone=Qwen3-8B, Training Condition=Base, Sampling strategy=avg@42026.05 | 39 | |
| Olmo3-7B-ITBackbone=Olmo3-7B-IT, Training Condition=Base, Sampling strategy=avg@42026.05 | 38.7 | |
| SDBackbone=Olmo3-7B-IT, Training Condition=+SD, Peak-mean step=10, Sampling strategy=avg@42026.05 | 38.5 | |
| GRPOBackbone=Qwen3-4B-IT-2507, Training Condition=+GRPO, Speedup=1.0×, Peak-mean step=200, Sampling strategy=avg@42026.05 | 33.2 | |
| GRPOBackbone=Olmo3-7B-IT, Training Condition=+GRPO, Speedup=1.0×, Peak-mean step=190, Sampling strategy=avg@42026.05 | 29.1 |