Mathematical Reasoning on MultiArith (Pass@1 and #L Metrics)
100Pass@1SFT-CoT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SFT-CoTBackbone=Qwen3-4B2026.05 | 100 | 40.9 | |
| Ours-RLBackbone=Qwen3-4B2026.05 | 99.44 | 15.7 | |
| SFT-CoTBackbone=Llama-3.2-1B2026.05 | 97.2 | 42.2 | |
| RoTBackbone=Qwen3-4B2026.05 | 97.2 | 32 | |
| Ours-RLBackbone=Llama-3.2-1B2026.05 | 96.67 | 14.18 | |
| Ours-SFTBackbone=Qwen3-4B2026.05 | 95 | 17.69 | |
| Latent-GRPOBase Model=LLaMA-3.2-1B-Instruct, Reasoning Mode=Latent Reasoning (No Sampling)2026.04 | 94.65 | 17.2 | |
| GRPOBase Model=LLaMA-3.2-1B-Instruct, Reasoning Mode=Explicit Reasoning2026.04 | 94.16 | 65.5 | |
| SFT-w/o CoTBackbone=Qwen3-4B2026.05 | 93.33 | 0 | |
| SFTBase Model=LLaMA-3.2-1B-Instruct, Reasoning Mode=Explicit Reasoning2026.04 | 92.23 | 45.49 | |
| Ours-SFTBackbone=Llama-3.2-1B2026.05 | 92.22 | 14.16 | |
| Soft-GRPOBase Model=LLaMA-3.2-1B-Instruct, Reasoning Mode=Latent Reasoning (No Sampling)2026.04 | 91.07 | 16.4 | |
| Latent-SFTBase Model=LLaMA-3.2-1B-Instruct, Reasoning Mode=Latent Reasoning (No Sampling)2026.04 | 90.8 | 16.3 | |
| CoLaR-2Backbone=Qwen3-4B2026.05 | 82.2 | 21.1 | |
| CoLaR-2Backbone=Llama-3.2-1B2026.05 | 70.18 | 19.33 | |
| CoconutBackbone=Qwen3-4B2026.05 | 60.3 | 6 | |
| CoconutBackbone=Llama-3.2-1B2026.05 | 52.55 | 6 | |
| SFT-w/o CoTBackbone=Llama-3.2-1B2026.05 | 41.67 | 0 |