Reasoning on SuperGPQA zero-shot latest
41.28AccuracyMIXED-CUTS
Evaluation Results
| Method | Links | |
|---|---|---|
| MIXED-CUTSBackbone=Qwen3-4B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.04 | 41.28 | |
| Standard GRPOBackbone=Qwen3-4B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.04 | 40.03 | |
| Base ModelBackbone=Qwen3-4B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.04 | 33.05 |