Mathematical Reasoning on ASDiv-Aug (accuracy)
92.14AccuracySoftCoT
Evaluation Results
| Method | Links | |
|---|---|---|
| SoftCoTN (Number of reasoning chains)=10, Base Model=Qwen3-8B2025.02 | 92.14 | |
| Zero-Shot CoTN (Number of reasoning chains)=10, Base Model=Qwen3-8B2025.02 | 91.97 | |
| Zero-Shot Assist-CoTN (Number of reasoning chains)=10, Base Model=Qwen3-8B2025.02 | 91.91 | |
| SoftCoTN (Number of reasoning chains)=1, Base Model=Qwen3-8B2025.02 | 91.83 | |
| Zero-Shot CoTN (Number of reasoning chains)=1, Base Model=Qwen3-8B2025.02 | 91.7 | |
| Zero-Shot Assist-CoTN (Number of reasoning chains)=1, Base Model=Qwen3-8B2025.02 | 91.64 | |
| CoconutN (Number of reasoning chains)=10, Base Model=Qwen3-8B2025.02 | 90.37 | |
| CoconutN (Number of reasoning chains)=1, Base Model=Qwen3-8B2025.02 | 89.4 | |
| SoftCoTBackbone=LLaMA-3.1-8B-Instruct2025.02 | 87.19 | |
| Zero-Shot Assist-CoTBackbone=LLaMA-3.1-8B-Instruct2025.02 | 86.96 | |
| Zero-Shot CoT-UnkBackbone=LLaMA-3.1-8B-Instruct2025.02 | 86.9 | |
| CoconutBackbone=LLaMA-3.1-8B-Instruct2025.02 | 86.8 | |
| Zero-Shot CoTBackbone=LLaMA-3.1-8B-Instruct2025.02 | 86.78 | |
| LoRA Fine-TuningBackbone=LLaMA-3.1-8B-Instruct2025.02 | 86.67 | |
| CoconutBackbone=GPT-22025.02 | 38.92 |