Mathematical Problem-solving on GSM8K (Pass@1)
91.6Pass@1Qwen-2.5-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen-2.5-7BTurkish Support=Advanced, Tokenization Efficiency=High, License Type=Apache 2.02026.01 | 91.6 | |
| R-ZeroIteration=32026.05 | 91.49 | |
| R-ZeroIteration=22026.05 | 91.37 | |
| R-ZeroIteration=12026.05 | 90.65 | |
| VHG (Soft)2026.05 | 90.61 | |
| Vanilla-GRPO2026.05 | 90.17 | |
| Vanilla-GRPOtraining_variant=w. SFT data2026.05 | 89.89 | |
| Llama-3.1-8BTurkish Support=Limited, Tokenization Efficiency=Low, License Type=Llama Community2026.01 | 84.5 | |
| Qwen3-4B-Base2026.05 | 73.91 | |
| Fine-tunedCR=1, Backbone=LLaMA2-13B, Fine-tuned Model=WizardMath-13B-V1.02025.04 | 63.96 | |
| IMPARTCR=32, Backbone=LLaMA2-13B, Fine-tuned Model=WizardMath-13B-V1.02025.04 | 60.2 | |
| DARECR=32, Backbone=LLaMA2-13B, Fine-tuned Model=WizardMath-13B-V1.02025.04 | 58.91 | |
| LowRankCR=32, Backbone=LLaMA2-13B, Fine-tuned Model=WizardMath-13B-V1.02025.04 | 56.25 | |
| Mistral-7B-v0.3Turkish Support=Moderate, Tokenization Efficiency=Moderate, License Type=Apache 2.02026.01 | 55 | |
| BackboneCR=1, Backbone=LLaMA2-13B, Fine-tuned Model=WizardMath-13B-V1.02025.04 | 17.8 |