Reasoning on MMLU-Pro (zero-shot latest)
69.65Accuracy (zero-shot)MIXED-CUTS
Evaluation Results
| Method | Links | |
|---|---|---|
| MIXED-CUTSBackbone=Qwen3-4B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.04 | 69.65 | |
| Standard GRPOBackbone=Qwen3-4B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.04 | 68.59 | |
| Base ModelBackbone=Qwen3-4B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.04 | 63.8 |