Mathematical Reasoning on AIME 2024 (held-out)
79.4AccuracyAntiSD
Evaluation Results
| Method | Links | |
|---|---|---|
| AntiSDBackbone=Qwen3-30B-A3B, Training Condition=+AntiSD, Speedup=2.9×, Peak-mean step=140, Sampling strategy=avg@322026.05 | 79.4 | |
| AntiSDBackbone=Qwen3-8B, Training Condition=+AntiSD, Speedup=5.0×, Peak-mean step=180, Sampling strategy=avg@322026.05 | 78.4 | |
| AntiSDBackbone=Olmo3-7B-TK, Training Condition=+AntiSD, Speedup=2.0×, Peak-mean step=40, Sampling strategy=avg@322026.05 | 77.6 | |
| SDBackbone=Olmo3-7B-TK, Training Condition=+SD, Peak-mean step=40, Sampling strategy=avg@322026.05 | 77.2 | |
| AntiSDBackbone=Qwen3-4B-IT-2507, Training Condition=+AntiSD, Speedup=10.0×, Peak-mean step=100, Sampling strategy=avg@322026.05 | 76.6 | |
| GRPOBackbone=Olmo3-7B-TK, Training Condition=+GRPO, Speedup=1.0×, Peak-mean step=80, Sampling strategy=avg@322026.05 | 76.5 | |
| Olmo3-7B-TKBackbone=Olmo3-7B-TK, Training Condition=Base, Sampling strategy=avg@322026.05 | 74.6 | |
| GRPOBackbone=Qwen3-30B-A3B, Training Condition=+GRPO, Speedup=1.0×, Peak-mean step=150, Sampling strategy=avg@322026.05 | 74.1 | |
| GRPOBackbone=Qwen3-8B, Training Condition=+GRPO, Speedup=1.0×, Peak-mean step=200, Sampling strategy=avg@322026.05 | 73.5 | |
| GRPOBackbone=Qwen3-4B-IT-2507, Training Condition=+GRPO, Speedup=1.0×, Peak-mean step=200, Sampling strategy=avg@322026.05 | 67.8 | |
| AntiSDBackbone=Olmo3-7B-IT, Training Condition=+AntiSD, Speedup=9.5×, Peak-mean step=200, Sampling strategy=avg@322026.05 | 62.4 | |
| Qwen3-4B-IT-2507Backbone=Qwen3-4B-IT-2507, Training Condition=Base, Sampling strategy=avg@322026.05 | 62.1 | |
| SDBackbone=Qwen3-4B-IT-2507, Training Condition=+SD, Peak-mean step=10, Sampling strategy=avg@322026.05 | 59.8 | |
| GRPOBackbone=Olmo3-7B-IT, Training Condition=+GRPO, Speedup=1.0×, Peak-mean step=190, Sampling strategy=avg@322026.05 | 57 | |
| SDBackbone=Olmo3-7B-IT, Training Condition=+SD, Peak-mean step=10, Sampling strategy=avg@322026.05 | 54.5 | |
| Olmo3-7B-ITBackbone=Olmo3-7B-IT, Training Condition=Base, Sampling strategy=avg@322026.05 | 53.3 | |
| HSDBase Model=Qwen3-32B-Base2026.06 | 46 | |
| GRPO + OPSDBase Model=Qwen3-32B-Base2026.06 | 43.2 | |
| RLSDBase Model=Qwen3-32B-Base2026.06 | 42.8 | |
| SDPOBase Model=Qwen3-32B-Base2026.06 | 42.3 | |
| OPSDBase Model=Qwen3-32B-Base2026.06 | 41.5 | |
| DAPOBase Model=Qwen3-32B-Base2026.06 | 41.1 | |
| SDBackbone=Qwen3-30B-A3B, Training Condition=+SD, Peak-mean step=60, Sampling strategy=avg@322026.05 | 40.9 | |
| GSPOBase Model=Qwen3-32B-Base2026.06 | 40.5 | |
| SDBackbone=Qwen3-8B, Training Condition=+SD, Peak-mean step=200, Sampling strategy=avg@322026.05 | 40.1 | |
| Dr. GRPOBase Model=Qwen3-32B-Base2026.06 | 39.8 | |
| GRPOBase Model=Qwen3-32B-Base2026.06 | 38.7 | |
| HSDBase Model=Qwen3-8B-Base2026.06 | 31.4 | |
| GRPO + OPSDBase Model=Qwen3-8B-Base2026.06 | 28.6 | |
| RLSDBase Model=Qwen3-8B-Base2026.06 | 28.2 | |
| Qwen3-30B-A3BBackbone=Qwen3-30B-A3B, Training Condition=Base, Sampling strategy=avg@322026.05 | 28.1 | |
| SDPOBase Model=Qwen3-8B-Base2026.06 | 27.9 | |
| OPSDBase Model=Qwen3-8B-Base2026.06 | 27.3 | |
| DAPOBase Model=Qwen3-8B-Base2026.06 | 26.8 | |
| GSPOBase Model=Qwen3-8B-Base2026.06 | 26.3 | |
| Dr. GRPOBase Model=Qwen3-8B-Base2026.06 | 25.6 | |
| Qwen3-8BBackbone=Qwen3-8B, Training Condition=Base, Sampling strategy=avg@322026.05 | 25.5 | |
| GRPOBase Model=Qwen3-8B-Base2026.06 | 24.5 |