Mathematical Reasoning on HMMT 2025 (held-out)
56.2AccuracyAntiSD
Evaluation Results
| Method | Links | |
|---|---|---|
| AntiSDBackbone=Olmo3-7B-TK, Training Condition=+AntiSD, Speedup=2.0×, Peak-mean step=40, Sampling strategy=avg@322026.05 | 56.2 | |
| AntiSDBackbone=Qwen3-30B-A3B, Training Condition=+AntiSD, Speedup=2.9×, Peak-mean step=140, Sampling strategy=avg@322026.05 | 55.2 | |
| AntiSDBackbone=Qwen3-8B, Training Condition=+AntiSD, Speedup=5.0×, Peak-mean step=180, Sampling strategy=avg@322026.05 | 54.4 | |
| GRPOBackbone=Olmo3-7B-TK, Training Condition=+GRPO, Speedup=1.0×, Peak-mean step=80, Sampling strategy=avg@322026.05 | 50.5 | |
| SDBackbone=Olmo3-7B-TK, Training Condition=+SD, Peak-mean step=40, Sampling strategy=avg@322026.05 | 48.3 | |
| Olmo3-7B-TKBackbone=Olmo3-7B-TK, Training Condition=Base, Sampling strategy=avg@322026.05 | 48.2 | |
| AntiSDBackbone=Qwen3-4B-IT-2507, Training Condition=+AntiSD, Speedup=10.0×, Peak-mean step=100, Sampling strategy=avg@322026.05 | 46.7 | |
| GRPOBackbone=Qwen3-30B-A3B, Training Condition=+GRPO, Speedup=1.0×, Peak-mean step=150, Sampling strategy=avg@322026.05 | 42.2 | |
| GRPOBackbone=Qwen3-8B, Training Condition=+GRPO, Speedup=1.0×, Peak-mean step=200, Sampling strategy=avg@322026.05 | 39.2 | |
| GRPOBackbone=Qwen3-4B-IT-2507, Training Condition=+GRPO, Speedup=1.0×, Peak-mean step=200, Sampling strategy=avg@322026.05 | 34.1 | |
| AntiSDBackbone=Olmo3-7B-IT, Training Condition=+AntiSD, Speedup=9.5×, Peak-mean step=200, Sampling strategy=avg@322026.05 | 32.3 | |
| GRPOBackbone=Olmo3-7B-IT, Training Condition=+GRPO, Speedup=1.0×, Peak-mean step=190, Sampling strategy=avg@322026.05 | 31.2 | |
| Qwen3-4B-IT-2507Backbone=Qwen3-4B-IT-2507, Training Condition=Base, Sampling strategy=avg@322026.05 | 30.4 | |
| SDBackbone=Qwen3-4B-IT-2507, Training Condition=+SD, Peak-mean step=10, Sampling strategy=avg@322026.05 | 28.8 | |
| Olmo3-7B-ITBackbone=Olmo3-7B-IT, Training Condition=Base, Sampling strategy=avg@322026.05 | 25.9 | |
| SDBackbone=Olmo3-7B-IT, Training Condition=+SD, Peak-mean step=10, Sampling strategy=avg@322026.05 | 24.4 | |
| SDBackbone=Qwen3-30B-A3B, Training Condition=+SD, Peak-mean step=60, Sampling strategy=avg@322026.05 | 20.9 | |
| SDBackbone=Qwen3-8B, Training Condition=+SD, Peak-mean step=200, Sampling strategy=avg@322026.05 | 14.9 | |
| Qwen3-30B-A3BBackbone=Qwen3-30B-A3B, Training Condition=Base, Sampling strategy=avg@322026.05 | 11.7 | |
| Qwen3-8BBackbone=Qwen3-8B, Training Condition=Base, Sampling strategy=avg@322026.05 | 10.8 |