Reasoning on Sudoku (Accuracy)
91.9Accuracy (Sudoku Reasoning)StepMerge (d2)
Evaluation Results
| Method | Links | |
|---|---|---|
| StepMerge (d2)Post-training=true2025.09 | 91.9 | |
| wd1Post-training=true, Evaluation Source=Corresponding paper2025.09 | 25.2 | |
| diffu-GRPO (d1)Post-training=true, Evaluation Source=Corresponding paper2025.09 | 22.1 | |
| LIFT3Backbone=LLaDA-1.52026.05 | 18.2 | |
| GIFTBackbone=LLaDA-1.52026.05 | 17.6 | |
| LIFT3Backbone=LLaDA-8B-Instruct2026.05 | 17.4 | |
| GIFTBackbone=LLaDA-8B-Instruct2026.05 | 17.3 | |
| DoRA†Backbone=LLaDA-8B-Instruct, LoRA Rank=128, Tuned Params (Usage %)=101.1M (1.25%), Steps=128, Zero-shot=true2026.03 | 17.2 | |
| CARTBackbone=LLaDA-1.52026.05 | 17 | |
| VanillaBackbone=LLaDA-8B-Instruct2026.05 | 16.8 | |
| LoRABackbone=LLaDA-8B-Instruct, LoRA Rank=128, Tuned Params (Usage %)=100.7M (1.24%), Steps=128, Zero-shot=true2026.03 | 16.5 | |
| LIFT2Backbone=LLaDA-8B-Instruct2026.05 | 16.5 | |
| LIFT2Backbone=LLaDA-1.52026.05 | 15.6 | |
| CARTBackbone=LLaDA-8B-Instruct2026.05 | 14.6 | |
| LoRA†Backbone=LLaDA-8B-Instruct, LoRA Rank=64, Tuned Params (Usage %)=50.3M (0.62%), Steps=128, Zero-shot=true2026.03 | 14.5 | |
| VanillaBackbone=LLaDA-1.52026.05 | 14.4 | |
| LLaDA 1.5Post-training=false, Evaluation Source=Released checkpoint2025.09 | 12.5 | |
| LLaDA 1.5Backbone=LLaDA-1.52026.05 | 12.1 | |
| LLaDAPost-training=false, Evaluation Source=Released checkpoint2025.09 | 11.8 | |
| LLaDABackbone=LLaDA-8B-Instruct2026.05 | 11.2 | |
| AlfaBackbone=LLaDA-8B-Instruct, LoRA Rank=64, Tuned Params (Usage %)=69.2M (0.85%), Steps=128, Zero-shot=true2026.03 | 9.7 | |
| LoRABackbone=LLaDA-8B-Instruct, LoRA Rank=128, Tuned Params (Usage %)=100.7M (1.24%), Steps=256, Zero-shot=true2026.03 | 8.5 | |
| AlfaBackbone=LLaDA-8B-Instruct, LoRA Rank=64, Tuned Params (Usage %)=69.2M (0.85%), Steps=256, Zero-shot=true2026.03 | 8.3 | |
| DoRA†Backbone=LLaDA-8B-Instruct, LoRA Rank=128, Tuned Params (Usage %)=101.1M (1.25%), Steps=256, Zero-shot=true2026.03 | 8 | |
| LoRA†Backbone=LLaDA-8B-Instruct, LoRA Rank=64, Tuned Params (Usage %)=50.3M (0.62%), Steps=256, Zero-shot=true2026.03 | 7.9 |