Mathematical Reasoning on MATH-500 (avg@K)
87.17Accuracy (avg@K)EGRSD
Evaluation Results
| Method | Links | |
|---|---|---|
| EGRSDBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,7682026.05 | 87.17 | |
| GRPOBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,7682026.05 | 87.15 | |
| OPSDBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,7682026.05 | 87.02 | |
| CRISPBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,7682026.05 | 86.94 | |
| Baseline (no-train)Backbone=Qwen3-4B, Training Budget=N/A, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,7682026.05 | 86.93 | |
| CL-EGRSDBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,7682026.05 | 86.92 | |
| SFTBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,7682026.05 | 83.65 |