Mathematical Reasoning on GSM8K-NL (test)
58.5AccuracyLT-Tuning + Adapter
Evaluation Results
| Method | Links | |
|---|---|---|
| LT-Tuning + AdapterBackbone=Llama-3.1-8B, Fine-tuning set=GSM8K training set, Adapter usage=true2026.02 | 58.5 | |
| LT-TuningBackbone=Llama-3.1-8B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 58.1 | |
| Soft-ThinkingBackbone=Llama-3.1-8B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 53.1 | |
| Explicit CoTBackbone=Llama-3.1-8B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 49.5 | |
| SoftCoTBackbone=Llama-3.1-8B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 36.8 | |
| CoconutBackbone=Llama-3.1-8B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 32.7 | |
| LT-TuningBackbone=Llama-3.2-3B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 32.1 | |
| CoconutBackbone=Llama-3.2-3B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 31.8 | |
| Explicit CoTBackbone=Llama-3.2-3B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 29.5 | |
| SoftCoTBackbone=Llama-3.2-3B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 26.9 | |
| Soft-ThinkingBackbone=Llama-3.2-3B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 24.2 | |
| SemCoTBackbone=Llama-3.1-8B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 21.5 | |
| SemCoTBackbone=Llama-3.2-3B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 16 | |
| LT-TuningBackbone=Llama-3.2-1B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 15.8 | |
| SemCoTBackbone=Llama-3.2-1B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 15 | |
| Explicit CoTBackbone=Llama-3.2-1B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 14.9 | |
| SoftCoTBackbone=Llama-3.2-1B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 14.9 | |
| CoconutBackbone=Llama-3.2-1B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 14.6 | |
| Soft-ThinkingBackbone=Llama-3.2-1B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 13.7 |