Mathematical Reasoning on GSM8K (avg@K)
94.26Accuracy (avg@K)CL-EGRSD
Evaluation Results
| Method | Links | |
|---|---|---|
| CL-EGRSDBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,7682026.05 | 94.26 | |
| CRISPBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,7682026.05 | 94.01 | |
| Baseline (no-train)Backbone=Qwen3-4B, Training Budget=N/A, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,7682026.05 | 93.96 | |
| GRPOBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,7682026.05 | 93.95 | |
| OPSDBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,7682026.05 | 93.89 | |
| EGRSDBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,7682026.05 | 93.88 | |
| SFTBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,7682026.05 | 87.19 |