Multi-step Reasoning on StrategyQA (test)
64.63AccuracyQwen3-4B + SFT + WeMask(TF)
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-4B + SFT + WeMask(TF)Mask Rate=0.3, Training Protocol=TF, Base Model=Qwen3-4B2026.05 | 64.63 | |
| Qwen3-4B + WeMask(SFT)Mask Rate=0.1, Training Protocol=SFT, Base Model=Qwen3-4B2026.05 | 64.54 | |
| Qwen3-4B + SFT + WeMask(TF)Mask Rate=0.1, Training Protocol=TF, Base Model=Qwen3-4B2026.05 | 64.24 | |
| Qwen3-4B + SFT + WeMask(TF)Mask Rate=0.7, Training Protocol=TF, Base Model=Qwen3-4B2026.05 | 64.22 | |
| Qwen3-4B + SFT + WeMask(TF)Mask Rate=0.5, Training Protocol=TF, Base Model=Qwen3-4B2026.05 | 64.19 | |
| Qwen3-4B + SFTMask Rate=-, Training Protocol=SFT, Base Model=Qwen3-4B2026.05 | 64.15 | |
| Qwen3-4B + WeMask(SFT)Mask Rate=0.3, Training Protocol=SFT, Base Model=Qwen3-4B2026.05 | 64.06 | |
| Qwen3-4B + WeMask(SFT)Mask Rate=0.5, Training Protocol=SFT, Base Model=Qwen3-4B2026.05 | 63.76 | |
| Qwen3-4B + WeMask(SFT)Mask Rate=0.7, Training Protocol=SFT, Base Model=Qwen3-4B2026.05 | 63.62 | |
| Qwen3-4B + WeMask(SFT)Mask Rate=1.0, Training Protocol=SFT, Base Model=Qwen3-4B2026.05 | 62.05 | |
| Qwen3-4B + SFT + WeMask(TF)Mask Rate=1.0, Training Protocol=TF, Base Model=Qwen3-4B2026.05 | 61.75 |