Language Modeling on AG News (val)
18.19PerplexityBlock Diffusion + Gumbel Distillation
Evaluation Results
| Method | Links | |
|---|---|---|
| Block Diffusion + Gumbel DistillationTraining Dataset=OWT, Evaluation Protocol=Zero-shot2026.03 | 18.19 | |
| MDLM + Gumbel DistillationTraining Dataset=OWT, Evaluation Protocol=Zero-shot2026.03 | 20.03 | |
| MDM-Prime-v2zero-shot=true, ℓ=16, variant=*2026.03 | 27.79 | |
| MDM-Prime-v2zero-shot=true, ℓ=162026.03 | 33.72 | |
| ARMzero-shot=true, variant=*2026.03 | 39.35 | |
| MDM-Primezero-shot=true, ℓ=6, variant=*2026.03 | 48.09 | |
| MDMzero-shot=true, variant=*2026.03 | 51.44 | |
| ARMzero-shot=true2026.03 | 52.09 | |
| ARParam=0.1B, Evaluation Protocol=Zero-shot2026.05 | 52.11 | |
| AR TransformerTraining steps=250K, Training Dataset=OWT, Zero-shot=true2025.06 | 55.53 | |
| LoopMDMS (inference-time loop count)=12, Zero-shot protocol=true, Model parameters=170M2026.05 | 56.6 | |
| EDLM-coARzero-shot=true2026.03 | 57.94 | |
| LoopMDMS (inference-time loop count)=6, Zero-shot protocol=true, Model parameters=170M2026.05 | 59.2 | |
| MDM-Primezero-shot=true, ℓ=42026.03 | 59.44 | |
| DCDMParam=0.1B, Training Tokens=128B, Evaluation Protocol=Zero-shot2026.05 | 59.85 | |
| EDLM-NCEzero-shot=true2026.03 | 60.02 | |
| MDM-Primezero-shot=true, ℓ=62026.03 | 60.16 | |
| MDMzero-shot=true2026.03 | 61.15 | |
| BD3-LMzero-shot=true2026.03 | 61.67 | |
| BDLMParam=0.1B, Training Tokens=256B, Evaluation Protocol=Zero-shot2026.05 | 61.67 | |
| BD3-LMTraining steps=250K, Training Dataset=OWT, Zero-shot=true, L'=162025.06 | 61.68 | |
| SEDDzero-shot=true2026.03 | 62.09 | |
| MDLMParam=0.1B, Training Tokens=256B, Evaluation Protocol=Zero-shot2026.05 | 62.78 | |
| Block DiffusionTraining Dataset=OWT, Evaluation Protocol=Zero-shot2026.03 | 63.09 | |
| MDM-Primezero-shot=true, ℓ=22026.03 | 63.21 | |
| MDM-Primezero-shot=true, ℓ=82026.03 | 64.89 | |
| Eso-LMsTraining steps=250K, Training Dataset=OWT, Zero-shot=true, alpha_0=0.1252025.06 | 65.26 | |
| MDLMTraining Dataset=OWT, Evaluation Protocol=Zero-shot2026.03 | 65.32 | |
| Duozero-shot=true2026.03 | 67.81 | |
| MDMZero-shot protocol=true, Model parameters=170M2026.05 | 69.3 | |
| MDLMTraining steps=250K, Training Dataset=OWT, Zero-shot=true2025.06 | 71.37 | |
| SEDD AbsorbTraining steps=250K, Training Dataset=OWT, Zero-shot=true2025.06 | 72.62 | |
| Eso-LMsTraining steps=250K, Training Dataset=OWT, Zero-shot=true, alpha_0=0.252025.06 | 75.74 | |
| Eso-LMsTraining steps=250K, Training Dataset=OWT, Zero-shot=true, alpha_0=0.52025.06 | 86.65 | |
| LoopMDMS (inference-time loop count)=1, Zero-shot protocol=true, Model parameters=170M2026.05 | 87.8 | |
| Eso-LMsTraining steps=250K, Training Dataset=OWT, Zero-shot=true, alpha_0=12025.06 | 98.22 |