Mathematical Reasoning on AIME 2026 (held-out)
76.1AccuracyAntiSD
Evaluation Results
| Method | Links | |
|---|---|---|
| AntiSDBackbone=Olmo3-7B-TK, Training Condition=+AntiSD, Speedup=2.0×, Peak-mean step=40, Sampling strategy=avg@322026.05 | 76.1 | |
| GRPOBackbone=Olmo3-7B-TK, Training Condition=+GRPO, Speedup=1.0×, Peak-mean step=80, Sampling strategy=avg@322026.05 | 75.3 | |
| AntiSDBackbone=Qwen3-4B-IT-2507, Training Condition=+AntiSD, Speedup=10.0×, Peak-mean step=100, Sampling strategy=avg@322026.05 | 74.4 | |
| AntiSDBackbone=Qwen3-30B-A3B, Training Condition=+AntiSD, Speedup=2.9×, Peak-mean step=140, Sampling strategy=avg@322026.05 | 74.1 | |
| SDBackbone=Olmo3-7B-TK, Training Condition=+SD, Peak-mean step=40, Sampling strategy=avg@322026.05 | 74 | |
| AntiSDBackbone=Qwen3-8B, Training Condition=+AntiSD, Speedup=5.0×, Peak-mean step=180, Sampling strategy=avg@322026.05 | 73.7 | |
| Olmo3-7B-TKBackbone=Olmo3-7B-TK, Training Condition=Base, Sampling strategy=avg@322026.05 | 73.3 | |
| GRPOBackbone=Qwen3-30B-A3B, Training Condition=+GRPO, Speedup=1.0×, Peak-mean step=150, Sampling strategy=avg@322026.05 | 65.5 | |
| GRPOBackbone=Qwen3-8B, Training Condition=+GRPO, Speedup=1.0×, Peak-mean step=200, Sampling strategy=avg@322026.05 | 64.2 | |
| GRPOBackbone=Qwen3-4B-IT-2507, Training Condition=+GRPO, Speedup=1.0×, Peak-mean step=200, Sampling strategy=avg@322026.05 | 63.5 | |
| AntiSDBackbone=Olmo3-7B-IT, Training Condition=+AntiSD, Speedup=9.5×, Peak-mean step=200, Sampling strategy=avg@322026.05 | 55.2 | |
| Qwen3-4B-IT-2507Backbone=Qwen3-4B-IT-2507, Training Condition=Base, Sampling strategy=avg@322026.05 | 53.8 | |
| GRPOBackbone=Olmo3-7B-IT, Training Condition=+GRPO, Speedup=1.0×, Peak-mean step=190, Sampling strategy=avg@322026.05 | 52.1 | |
| SDBackbone=Qwen3-4B-IT-2507, Training Condition=+SD, Peak-mean step=10, Sampling strategy=avg@322026.05 | 52 | |
| SDBackbone=Olmo3-7B-IT, Training Condition=+SD, Peak-mean step=10, Sampling strategy=avg@322026.05 | 46.6 | |
| Olmo3-7B-ITBackbone=Olmo3-7B-IT, Training Condition=Base, Sampling strategy=avg@322026.05 | 44.4 | |
| SDBackbone=Qwen3-30B-A3B, Training Condition=+SD, Peak-mean step=60, Sampling strategy=avg@322026.05 | 34 | |
| SDBackbone=Qwen3-8B, Training Condition=+SD, Peak-mean step=200, Sampling strategy=avg@322026.05 | 26.9 | |
| Qwen3-30B-A3BBackbone=Qwen3-30B-A3B, Training Condition=Base, Sampling strategy=avg@322026.05 | 21.8 | |
| Qwen3-8BBackbone=Qwen3-8B, Training Condition=Base, Sampling strategy=avg@322026.05 | 17 |