Mathematical Reasoning on Minerva-Math (avg@K)
33.23Avg@KOPSD
Evaluation Results
| Method | Links | |
|---|---|---|
| OPSDBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,7682026.05 | 33.23 | |
| Baseline (no-train)Backbone=Qwen3-4B, Training Budget=N/A, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,7682026.05 | 33.09 | |
| GRPOBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,7682026.05 | 32.9 | |
| CL-EGRSDBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,7682026.05 | 32.9 | |
| CRISPBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,7682026.05 | 32.84 | |
| EGRSDBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,7682026.05 | 32.81 | |
| SFTBackbone=Qwen3-4B, Training Budget=100-step, Thinking Mode=True, K (Samples per prompt)=4, Temperature=1.0, Top-p=0.95, Max Tokens=32,7682026.05 | 26.47 |