Mathematical Reasoning on AIME 24 (accuracy, delta)
14AccuracyBerr. Latent
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Berr. LatentCollaboration space=Latent-space, Description=Best latent-space DDLM→ARM result, Projector training=trained Linear-GELU-Linear projector on 35K domain-specific samples2026.02 | 14 | — | |
| Qwen2.5-Math-7B w/ CADFTBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=CADFT, Evaluation Protocol=Average@162026.04 | 10.41 | — | |
| Qwen2.5-Math-1.5B w/ CADFTBackbone=Qwen2.5-Math-1.5B, Fine-tuning Protocol=CADFT, Evaluation Protocol=Average@162026.04 | 8.76 | — | |
| Qwen2.5-Math-7B w/ DFTBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=DFT, Evaluation Protocol=Average@162026.04 | 8.56 | — | |
| Qwen2.5-Math-1.5B w/ DFTBackbone=Qwen2.5-Math-1.5B, Fine-tuning Protocol=DFT, Evaluation Protocol=Average@162026.04 | 6.87 | — | |
| Qwen2.5-Math-7BBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=None, Evaluation Protocol=Average@162026.04 | 6.68 | — | |
| Qwen2.5-Math-1.5BBackbone=Qwen2.5-Math-1.5B, Fine-tuning Protocol=None, Evaluation Protocol=Average@162026.04 | 4.16 | — | |
| LLaDA + Sonnet PlanPlan conditioning=Sonnet Plan2026.02 | 3.3 | 3.3 | |
| Qwen2.5-Math-7B w/ SFTBackbone=Qwen2.5-Math-7B, Fine-tuning Protocol=SFT, Evaluation Protocol=Average@162026.04 | 2.48 | — | |
| Qwen2.5-Math-1.5B w/ SFTBackbone=Qwen2.5-Math-1.5B, Fine-tuning Protocol=SFT, Evaluation Protocol=Average@162026.04 | 1.87 | — | |
| DeepSeekMath-7B w/ CADFTBackbone=DeepSeekMath-7B, Fine-tuning Protocol=CADFT, Evaluation Protocol=Average@162026.04 | 1.65 | — | |
| Berr. BLDescription=LLaDA-only baseline by Berrayana et al.2026.02 | 1.5 | — | |
| Berr. TextCollaboration space=Text-space, Description=Best text-space collaboration result2026.02 | 1.5 | — | |
| DeepSeekMath-7B w/ DFTBackbone=DeepSeekMath-7B, Fine-tuning Protocol=DFT, Evaluation Protocol=Average@162026.04 | 1.24 | — | |
| LLaMA-3.2-3B w/ CADFTBackbone=LLaMA-3.2-3B, Fine-tuning Protocol=CADFT, Evaluation Protocol=Average@162026.04 | 1.05 | — | |
| LLaMA-3.2-3B w/ DFTBackbone=LLaMA-3.2-3B, Fine-tuning Protocol=DFT, Evaluation Protocol=Average@162026.04 | 0.83 | — | |
| LLaMA-3.1-8B w/ CADFTBackbone=LLaMA-3.1-8B, Fine-tuning Protocol=CADFT, Evaluation Protocol=Average@162026.04 | 0.65 | — | |
| LLaMA-3.2-3BBackbone=LLaMA-3.2-3B, Fine-tuning Protocol=None, Evaluation Protocol=Average@162026.04 | 0.41 | — | |
| LLaMA-3.1-8B w/ DFTBackbone=LLaMA-3.1-8B, Fine-tuning Protocol=DFT, Evaluation Protocol=Average@162026.04 | 0.41 | — | |
| DeepSeekMath-7B w/ SFTBackbone=DeepSeekMath-7B, Fine-tuning Protocol=SFT, Evaluation Protocol=Average@162026.04 | 0.41 | — | |
| LLaMA-3.1-8BBackbone=LLaMA-3.1-8B, Fine-tuning Protocol=None, Evaluation Protocol=Average@162026.04 | 0.21 | — | |
| DeepSeekMath-7BBackbone=DeepSeekMath-7B, Fine-tuning Protocol=None, Evaluation Protocol=Average@162026.04 | 0.21 | — | |
| LLaDADescription=LLaDA-only baseline2026.02 | 0 | — | |
| LLaMA-3.2-3B w/ SFTBackbone=LLaMA-3.2-3B, Fine-tuning Protocol=SFT, Evaluation Protocol=Average@162026.04 | 0 | — | |
| LLaMA-3.1-8B w/ SFTBackbone=LLaMA-3.1-8B, Fine-tuning Protocol=SFT, Evaluation Protocol=Average@162026.04 | 0 | — |