Mathematical Reasoning on GSM8K (test) (ACC, LEN, Ratio)
94.62ACCBaseline
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BaselineModel=Qwen3-4B, Temperature=Constant, Maximum context length=8K tokens2026.01 | 94.62 | 1,097.4 | 41.5 | |
| TALE-EPModel=Qwen3-4B, Temperature=Constant, Maximum context length=8K tokens2026.01 | 94.39 | 561.5 | 49.7 | |
| DiPOModel=Qwen3-4B, Temperature=Constant, Maximum context length=8K tokens2026.01 | 94.31 | 362.5 | 58.2 | |
| SFTModel=Qwen3-4B, Temperature=Constant, Maximum context length=8K tokens2026.01 | 94.24 | 1,086.2 | 41.2 | |
| CoDModel=Qwen3-4B, Temperature=Constant, Maximum context length=8K tokens2026.01 | 94.16 | 464.2 | 55.8 | |
| CoDModel=Qwen3-8B*, Temperature=Constant, Maximum context length=8K tokens2026.01 | 94.16 | 2,123.4 | 18.7 | |
| DPOModel=Qwen3-4B, Temperature=Constant, Maximum context length=8K tokens2026.01 | 94.09 | 1,087.7 | 41 | |
| SFTModel=Qwen3-8B*, Temperature=Constant, Maximum context length=8K tokens2026.01 | 94.09 | 1,448.1 | 29.6 | |
| BaselineModel=Qwen3-8B*, Temperature=Constant, Maximum context length=8K tokens2026.01 | 93.93 | 1,726.3 | 26.7 | |
| DiPOModel=Qwen3-8B*, Temperature=Constant, Maximum context length=8K tokens2026.01 | 93.78 | 494.7 | 63 | |
| DPOModel=Qwen3-8B*, Temperature=Constant, Maximum context length=8K tokens2026.01 | 93.63 | 1,740.1 | 26.7 | |
| TALE-EPModel=Qwen3-8B*, Temperature=Constant, Maximum context length=8K tokens2026.01 | 93.33 | 1,846 | 20.5 | |
| Explicit CoTBackbone=LLAMA-3.2-3B-INSTRUCT, Training Data=GSM8k-Aug (natural language)2026.06 | 68.41 | — | — | |
| LOTUSBackbone=LLAMA-3.2-3B-INSTRUCT, Training Data=GSM8k-Aug (natural language)2026.06 | 68.13 | — | — | |
| KaVaBackbone=LLAMA-3.2-3B-INSTRUCT, Training Data=GSM8k-Aug (natural language)2026.06 | 60 | — | — | |
| CODIBackbone=LLAMA-3.2-3B-INSTRUCT, Training Data=GSM8k-Aug (natural language)2026.06 | 55.9 | — | — | |
| PCCoTBackbone=LLAMA-3.2-3B-INSTRUCT, Training Data=GSM8k-Aug (natural language)2026.06 | 47.6 | — | — |