Mathematical Reasoning on Olympiad (Pass@1, Pass@100)
13.3Pass@1Discrete Latent
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Discrete LatentBackbone=LLAMA 3.1 8B2025.10 | 13.3 | 17.8 | |
| LaDiRBackbone=LLAMA 3.1 8B2025.10 | 12.9 | 15.3 | |
| TaH+Backbone=LLAMA 3.1 8B2025.10 | 12.2 | 15.2 | |
| SFTBackbone=LLAMA 3.1 8B, Decoding temperature (alpha)=0.12025.10 | 10.5 | 11.1 | |
| Soft ThinkBackbone=LLAMA 3.1 8B2025.10 | 10.4 | 13.1 | |
| SFTBackbone=LLAMA 3.1 8B, Decoding temperature (alpha)=0.72025.10 | 9.9 | 12.6 | |
| SFTBackbone=LLAMA 3.1 8B, Decoding temperature (alpha)=12025.10 | 9.4 | 13.5 | |
| SFTBackbone=LLAMA 3.1 8B, Decoding temperature (alpha)=1.22025.10 | 8.9 | 14.6 | |
| CODIBackbone=LLAMA 3.1 8B2025.10 | 7.6 | 14.8 | |
| CoT SFTBackbone=LLADA 8B2025.10 | 5.9 | 10.2 | |
| LaDiR –w/o Stage 2Backbone=LLAMA 3.1 8B, Training Stage=without Stage 22025.10 | 5.9 | 10.5 | |
| CoconutBackbone=LLAMA 3.1 8B2025.10 | 5.8 | 6.3 | |
| Sol-Only SFTBackbone=LLAMA 3.1 8B2025.10 | 4.7 | 10.9 | |
| iCoTBackbone=LLAMA 3.1 8B2025.10 | 4.3 | 7.1 | |
| Pause TokenBackbone=LLAMA 3.1 8B2025.10 | 3.5 | 7.8 | |
| Base ModelBackbone=LLADA 8B2025.10 | 3 | 7.7 | |
| LD4LGBackbone=LLAMA 3.1 8B2025.10 | 2.8 | 8.6 | |
| PLANNERBackbone=LLAMA 3.1 8B2025.10 | 2.2 | 9 |