Mathematical Reasoning on GSM8K Platinum
90.57AccuracyBaseline (Greedy)
Evaluation Results
| Method | Links | |
|---|---|---|
| Baseline (Greedy)Backbone=Qwen3-8B2026.01 | 90.57 | |
| DoLaBackbone=Qwen3-8B, Penalty=1.02026.01 | 90.16 | |
| Temporal GuidanceBackbone=Qwen3-8B, Alpha=0.42026.01 | 90.16 | |
| Contrastive DecodingBackbone=Qwen3-8B, Amateur Model=Qwen3-0.6B2026.01 | 90.07 | |
| Temporal GuidanceBackbone=Qwen3-8B, Alpha=0.12026.01 | 89.83 | |
| Temporal GuidanceBackbone=Qwen3-8B, Alpha=0.32026.01 | 89.83 | |
| Temporal GuidanceBackbone=Qwen3-8B, Alpha=0.52026.01 | 89.83 | |
| Contrastive DecodingBackbone=Qwen3-8B, Amateur Model=Qwen3-1.7B2026.01 | 89.82 | |
| DoLaBackbone=Qwen3-8B, Penalty=1.22026.01 | 89.33 | |
| Temporal GuidanceBackbone=Qwen3-8B, Alpha=0.22026.01 | 89.25 | |
| Temporal GuidanceBackbone=Qwen3-1.7B, Alpha=0.22026.01 | 72.21 | |
| Temporal GuidanceBackbone=Qwen3-1.7B, Alpha=0.12026.01 | 71.71 | |
| Contrastive DecodingBackbone=Qwen3-1.7B, Amateur Model=Qwen3-0.6B2026.01 | 71.29 | |
| DoLaBackbone=Qwen3-1.7B, Penalty=1.22026.01 | 71.05 | |
| Baseline (Greedy)Backbone=Qwen3-1.7B2026.01 | 70.64 | |
| DoLaBackbone=Qwen3-1.7B, Penalty=1.02026.01 | 68.07 | |
| MonoSoupSetting=M-2 (Cosine)2026.02 | 59.4 | |
| MonoSoup R = 0.8Setting=M-2 (Cosine)2026.02 | 59.3 | |
| MonoSoupSetting=M-3 (Ext.)2026.02 | 59.2 | |
| ModelStock (M-1, M-2)Setting=Pairwise2026.02 | 59 | |
| LINESSetting=M-2 (Cosine)2026.02 | 58.9 | |
| ModelStock (M-2, M-3)Setting=Pairwise2026.02 | 58.9 | |
| MonoSoup R = 0.8Setting=M-3 (Ext.)2026.02 | 58.8 | |
| ModelStock (M-1, M-3)Setting=Pairwise2026.02 | 58.7 | |
| StandardSetting=M-2 (Cosine)2026.02 | 58.5 | |
| LINESSetting=M-3 (Ext.)2026.02 | 58.1 | |
| StandardSetting=M-3 (Ext.)2026.02 | 57.3 | |
| MonoSoupSetting=M-1 (Linear)2026.02 | 56.8 | |
| MonoSoup R = 0.8Setting=M-1 (Linear)2026.02 | 56.7 | |
| LINESSetting=M-1 (Linear)2026.02 | 56.3 | |
| StandardSetting=M-1 (Linear)2026.02 | 55.6 | |
| QWEN3-0.6B-BASESetting=Reference2026.02 | 50.1 | |
| Temporal GuidanceBackbone=Llama-3.2-3B, Alpha=0.12026.01 | 28.37 | |
| DoLaBackbone=Llama-3.2-3B, Penalty=1.02026.01 | 27.63 | |
| Baseline (Greedy)Backbone=Llama-3.2-3B2026.01 | 27.13 | |
| DoLaBackbone=Llama-3.2-3B, Penalty=1.22026.01 | 26.88 | |
| Temporal GuidanceBackbone=Llama-3.2-3B, Alpha=0.22026.01 | 26.39 |