Mathematical Reasoning on HMMT25 (Avg@16 accuracy (%))
33.2Avg@16 AccuracyTRD
Evaluation Results
| Method | Links | |
|---|---|---|
| TRDModel=Qwen3-4B-Instruct-2507, Traj.=yr2026.06 | 33.2 | |
| BaseModel=Qwen3-4B-Instruct-2507, Traj.=–2026.06 | 31.3 | |
| Reverse KLModel=Qwen3-4B-Instruct-2507, Traj.=yo2026.06 | 31.3 | |
| Reverse KL w/ Top-KModel=Qwen3-4B-Instruct-2507, Traj.=yo2026.06 | 30.6 | |
| Forward KLModel=Qwen3-4B-Instruct-2507, Traj.=yo2026.06 | 30.4 | |
| Forward KL w/ ClipModel=Qwen3-4B-Instruct-2507, Traj.=yo2026.06 | 29.8 | |
| DASDBackbone=Qwen3-4B2026.05 | 25 | |
| DASDBackbone=Qwen3-8B2026.05 | 25 | |
| TRDModel=Qwen3-1.7B (w/ thinking), Traj.=yr2026.06 | 24.4 | |
| BaseModel=Qwen3-1.7B (w/ thinking), Traj.=–2026.06 | 24.2 | |
| Reverse KL w/ Top-KModel=Qwen3-1.7B (w/ thinking), Traj.=yo2026.06 | 23.8 | |
| Forward KLModel=Qwen3-1.7B (w/ thinking), Traj.=yo2026.06 | 23.3 | |
| Forward KL w/ ClipModel=Qwen3-1.7B (w/ thinking), Traj.=yo2026.06 | 22.9 | |
| Reverse KLModel=Qwen3-1.7B (w/ thinking), Traj.=yo2026.06 | 22.9 | |
| GRPOBackbone=Qwen3-4B2026.05 | 22.1 | |
| HEPOBackbone=Qwen3-4B2026.05 | 21.2 | |
| GRPOBackbone=Qwen3-8B2026.05 | 20.8 | |
| RLSDBackbone=Qwen3-8B2026.05 | 20.8 | |
| RLSDBackbone=Qwen3-4B2026.05 | 20.4 | |
| HEPOBackbone=Qwen3-8B2026.05 | 20.4 | |
| DASDBackbone=Qwen3-1.7B2026.05 | 17.7 | |
| SRPOBackbone=Qwen3-4B2026.05 | 17.7 | |
| SRPOBackbone=Qwen3-8B2026.05 | 17.5 | |
| HEPOBackbone=Qwen3-1.7B2026.05 | 15.6 | |
| RLSDBackbone=Qwen3-1.7B2026.05 | 15.2 | |
| Qwen3-4BBackbone=Qwen3-4B2026.05 | 15.2 | |
| OPSDBackbone=Qwen3-8B2026.05 | 15 | |
| SDPOBackbone=Qwen3-8B2026.05 | 14.4 | |
| SDPOBackbone=Qwen3-4B2026.05 | 13.3 | |
| Qwen3-8BBackbone=Qwen3-8B2026.05 | 13.1 | |
| OPSDBackbone=Qwen3-4B2026.05 | 12.9 | |
| GRPOBackbone=Qwen3-1.7B2026.05 | 11.5 | |
| SRPOBackbone=Qwen3-1.7B2026.05 | 10.2 | |
| OPSDBackbone=Qwen3-1.7B2026.05 | 8.5 | |
| SDPOBackbone=Qwen3-1.7B2026.05 | 8.1 | |
| Qwen3-1.7BBackbone=Qwen3-1.7B2026.05 | 7.9 |