Mathematical Reasoning on ASDiv Aug (test)
88.9AccuracySoftCoT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SoftCoTBackbone=Qwen2.5-7B-Instruct, Training Objective=Language Modeling Objective, Evaluation Protocol=Projection Module Trained2025.02 | 88.9 | 75.06 | |
| Zero-Shot Assist-CoTBackbone=Qwen2.5-7B-Instruct, Training Objective=None, Evaluation Protocol=Zero-Shot2025.02 | 88.63 | 71.64 | |
| Zero-Shot CoTBackbone=Qwen2.5-7B-Instruct, Training Objective=None, Evaluation Protocol=Zero-Shot2025.02 | 87.19 | 70.29 | |
| Zero-Shot CoT-UnkBackbone=Qwen2.5-7B-Instruct, Training Objective=None, Evaluation Protocol=Zero-Shot2025.02 | 86.94 | 70.6 | |
| CoconutBackbone=Qwen2.5-7B-Instruct, Training Objective=Language Modeling Objective, Evaluation Protocol=Finetuned2025.02 | 86.9 | — | |
| LoRA Fine-TuningBackbone=Qwen2.5-7B-Instruct, Training Objective=Language Modeling Objective, Evaluation Protocol=Fine-Tuning2025.02 | 86.8 | — | |
| SemCoTBackbone=Llama-3.1-8B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 77 | — | |
| Soft-ThinkingBackbone=Llama-3.1-8B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 74.9 | — | |
| LT-TuningBackbone=Llama-3.1-8B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 72.2 | — | |
| LT-Tuning + AdapterBackbone=Llama-3.1-8B, Fine-tuning set=GSM8K training set, Adapter usage=true2026.02 | 70.7 | — | |
| Soft-ThinkingBackbone=Llama-3.2-3B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 70.3 | — | |
| Explicit CoTBackbone=Llama-3.2-3B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 69.8 | — | |
| Explicit CoTBackbone=Llama-3.1-8B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 69.6 | — | |
| LT-TuningBackbone=Llama-3.2-3B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 67.2 | — | |
| CoconutBackbone=Llama-3.2-3B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 61.9 | — | |
| SoftCoTBackbone=Llama-3.2-3B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 55.5 | — | |
| SoftCoTBackbone=Llama-3.2-1B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 54.1 | — | |
| LT-TuningBackbone=Llama-3.2-1B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 53.9 | — | |
| SemCoTBackbone=Llama-3.2-3B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 52.5 | — | |
| SoftCoTBackbone=Llama-3.1-8B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 46.2 | — | |
| Explicit CoTBackbone=Llama-3.2-1B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 44.8 | — | |
| CoconutBackbone=Llama-3.2-1B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 42.5 | — | |
| SemCoTBackbone=Llama-3.2-1B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 40 | — | |
| Soft-ThinkingBackbone=Llama-3.2-1B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 39.3 | — | |
| CoconutBackbone=Llama-3.1-8B, Fine-tuning set=GSM8K training set, Adapter usage=false2026.02 | 38.8 | — |