Mathematical Reasoning on HMMT25 (Avg@16, Pass@16)
21.67Average Score @16CAST
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CASTModel Scale=Qwen3-4B2026.05 | 21.67 | 50 | |
| CASTModel Scale=Qwen3-8B2026.05 | 18.96 | 43.3 | |
| RLRTModel Scale=Qwen3-8B2026.05 | 13.33 | 30 | |
| CASTModel Scale=Qwen3-1.7B2026.05 | 13.12 | 30 | |
| GRPO+OPSDModel Scale=Qwen3-4B2026.05 | 12.92 | 23.3 | |
| RLRTModel Scale=Qwen3-4B2026.05 | 12.92 | 26.7 | |
| GRPOModel Scale=Qwen3-4B2026.05 | 12.08 | 30 | |
| RLSDModel Scale=Qwen3-4B2026.05 | 11.88 | 23.3 | |
| RLSDModel Scale=Qwen3-8B2026.05 | 11.88 | 26.7 | |
| GRPO+OPSDModel Scale=Qwen3-8B2026.05 | 11.25 | 30 | |
| BaseModel Scale=Qwen3-8B2026.05 | 10.83 | 26.7 | |
| BaseModel Scale=Qwen3-4B2026.05 | 10.21 | 23.3 | |
| GRPOModel Scale=Qwen3-8B2026.05 | 9.58 | 30 | |
| OPSDModel Scale=Qwen3-8B2026.05 | 7.08 | 20 | |
| BaseModel Scale=Qwen3-1.7B2026.05 | 6.04 | 26.7 | |
| RLSDModel Scale=Qwen3-1.7B2026.05 | 6.04 | 26.7 | |
| GRPO+OPSDModel Scale=Qwen3-1.7B2026.05 | 5.62 | 26.7 | |
| RLRTModel Scale=Qwen3-1.7B2026.05 | 5.62 | 16.7 | |
| GRPOModel Scale=Qwen3-1.7B2026.05 | 4.38 | 10 | |
| OPSDModel Scale=Qwen3-4B2026.05 | 2.29 | 10 | |
| OPSDModel Scale=Qwen3-1.7B2026.05 | 1.88 | 10 |