Mathematical Reasoning on GSM8K zero-shot
77.6AccuracyConfidence-Adaptive Decoding (CAD)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Confidence-Adaptive Decoding (CAD)Generation Paradigm=Block Diffusion (b=32), Tokens/Step=1–32, Backbone=LLaDA-8B-Instruct, Maximum sequence length (Lgen)=2562026.01 | 77.6 | 76.3 | 38.7 | 5.18 | |
| LLaDAGeneration Paradigm=Block Diffusion (b=32), Tokens/Step=1, Backbone=LLaDA-8B-Instruct, Maximum sequence length (Lgen)=2562026.01 | 77.4 | 256 | 7.5 | 1 | |
| Fast-dLLMGeneration Paradigm=Block Diffusion (b=32), Backbone=LLaDA-8B-Instruct, Parallel decoding strategy=without KV cache, Maximum sequence length (Lgen)=2562026.01 | 76.9 | 78.7 | 18.4 | 2.46 | |
| LLaDAGeneration Paradigm=Sequential (b=1), Tokens/Step=1, Backbone=LLaDA-8B-Instruct, Maximum sequence length (Lgen)=2562026.01 | 76.4 | 256 | 7.5 | 1 | |
| LLaDAGeneration Paradigm=Block Diffusion (b=32), Tokens/Step=2, Backbone=LLaDA-8B-Instruct, Maximum sequence length (Lgen)=2562026.01 | 74.8 | 128 | 14.9 | 1.99 | |
| Confidence-Adaptive Decoding (CAD)Generation Paradigm=Pure Diffusion (b=256), Tokens/Step=1–32, Backbone=LLaDA-8B-Instruct, Maximum sequence length (Lgen)=2562026.01 | 54.7 | 80.6 | 36.7 | 4.91 | |
| LLaDAGeneration Paradigm=Pure Diffusion (b=256), Tokens/Step=1, Backbone=LLaDA-8B-Instruct, Maximum sequence length (Lgen)=2562026.01 | 13.8 | 256 | 7.5 | 1 | |
| LLaDAGeneration Paradigm=Pure Diffusion (b=256), Tokens/Step=2, Backbone=LLaDA-8B-Instruct, Maximum sequence length (Lgen)=2562026.01 | 13 | 128 | 14.9 | 1.99 |