Mathematical Reasoning on GSM-8K (Score)
89.11AccuracyQwen3-8B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-8BVariant=Fine-tune2026.03 | 89.11 | |
| Qwen3-8BVariant=SFA (k = 16)2026.03 | 87.99 | |
| Qwen3-8BVariant=Base2026.03 | 87.62 | |
| Qwen3-4BVariant=Fine-tune2026.03 | 76.18 | |
| Qwen3-4BVariant=SFA (k = 16)2026.03 | 75.56 | |
| Qwen3-4BVariant=Base2026.03 | 75.44 | |
| S³Backbone=LLaDA-8B-Instruct, Decoding Strategy=S³, N (S³)=4, b (S³)=2, K (Best-of-K)=642026.04 | 70.21 | |
| Best-of-KBackbone=LLaDA-8B-Instruct, Decoding Strategy=Best-of-K, K (Best-of-K)=82026.04 | 69.56 | |
| KEELTraining=SFT, Evaluation Setting=5-shot2026.01 | 68.8 | |
| Baseline DiffusionBackbone=LLaDA-8B-Instruct, Decoding Strategy=Standard Diffusion2026.04 | 68.16 | |
| Qwen3-0.6BVariant=Fine-tune2026.03 | 63.42 | |
| Qwen3-0.6BVariant=SFA (k = 16)2026.03 | 61.46 | |
| KEELArchitecture=512 Layers / 3B Params, Peak Learning Rate=4.5 x 10^-3, Pre-training Tokens=1T, Evaluation Protocol (Shots)=5-shot2026.01 | 60.9 | |
| Qwen3-0.6BVariant=Base2026.03 | 59.59 | |
| Pre-LNTraining=SFT, Evaluation Setting=5-shot2026.01 | 58.7 | |
| Pre-LNArchitecture=512 Layers / 3B Params, Peak Learning Rate=3.0 x 10^-3, Pre-training Tokens=1T, Evaluation Protocol (Shots)=5-shot2026.01 | 51 |