Mathematical Reasoning on Math (Acc. (%), ∆ (%))
80.8Accuracy (%)TRACELOCK
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TRACELOCKModel=Dream, Gen len=256, Win./Block=64, Avg. step=106.12026.05 | 80.8 | — | |
| TRACELOCKModel=Dream, Gen len=256, Win./Block=128, Avg. step=114.12026.05 | 80.7 | — | |
| TRACELOCKModel=LLaDA, Gen len=256, Win./Block=64, Avg. step=144.92026.05 | 80 | — | |
| ConfidenceModel=Dream, Gen len=256, Win./Block=64, Avg. step=256.02026.05 | 79.9 | — | |
| Fast-dLLMModel=Dream, Gen len=256, Win./Block=64, Avg. step=197.42026.05 | 79.9 | — | |
| ConfidenceModel=LLaDA, Gen len=256, Win./Block=64, Avg. step=256.02026.05 | 79.8 | — | |
| ED-GRPOBackbone=Qwen2.5-7B-Instruct, Decoding Strategy=Self-Consistency2026.05 | 79.4 | 6.6 | |
| Fast-dLLMModel=LLaDA, Gen len=256, Win./Block=64, Avg. step=79.42026.05 | 79.4 | — | |
| ED-iDPOBackbone=Qwen2.5-7B-Instruct, Decoding Strategy=Self-Consistency2026.05 | 78.6 | 5.8 | |
| GRPOBackbone=Qwen2.5-7B-Instruct, Decoding Strategy=Self-Consistency2026.05 | 78.4 | 5.6 | |
| DAPOBackbone=Qwen2.5-7B-Instruct, Decoding Strategy=Self-Consistency2026.05 | 78.4 | 5.6 | |
| L2PModel=LLaDA, Gen len=256, Win./Block=64, Avg. step=57.42026.05 | 78.3 | — | |
| ETOBackbone=Qwen2.5-7B-Instruct, Decoding Strategy=Self-Consistency2026.05 | 77.4 | 4.6 | |
| TRACELOCKModel=LLaDA, Gen len=256, Win./Block=128, Avg. step=154.32026.05 | 76.5 | — | |
| ED-GRPOBackbone=Qwen2.5-7B-Instruct, Decoding Strategy=Greedy2026.05 | 76.4 | 3.6 | |
| Fast-dLLMModel=LLaDA, Gen len=256, Win./Block=128, Avg. step=80.42026.05 | 76.4 | — | |
| CoTBackbone=Qwen2.5-7B-Instruct, Decoding Strategy=Self-Consistency2026.05 | 76.2 | 3.4 | |
| ConfidenceModel=LLaDA, Gen len=256, Win./Block=128, Avg. step=256.02026.05 | 76 | — | |
| DAPOBackbone=Qwen2.5-7B-Instruct, Decoding Strategy=Greedy2026.05 | 75.2 | 2.4 | |
| TRACELOCKModel=LLaDA, Gen len=128, Win./Block=32, Avg. step=84.12026.05 | 74.9 | — | |
| Fast-dLLMModel=LLaDA, Gen len=128, Win./Block=32, Avg. step=54.32026.05 | 74.8 | — | |
| L2PModel=LLaDA, Gen len=128, Win./Block=32, Avg. step=44.72026.05 | 74.8 | — | |
| ConfidenceModel=LLaDA, Gen len=128, Win./Block=32, Avg. step=128.02026.05 | 74.4 | — | |
| GRPOBackbone=Qwen2.5-7B-Instruct, Decoding Strategy=Greedy2026.05 | 74.2 | 1.4 | |
| ConfidenceModel=Dream, Gen len=128, Win./Block=32, Avg. step=128.02026.05 | 73.8 | — | |
| ConfidenceModel=LLaDA, Gen len=128, Win./Block=64, Avg. step=128.02026.05 | 73.5 | — | |
| Fast-dLLMModel=LLaDA, Gen len=128, Win./Block=64, Avg. step=53.42026.05 | 73.5 | — | |
| TRACELOCKModel=Dream, Gen len=128, Win./Block=32, Avg. step=107.52026.05 | 73.5 | — | |
| ETOBackbone=Qwen2.5-7B-Instruct, Decoding Strategy=Greedy2026.05 | 73.2 | 0.4 | |
| Fast-dLLMModel=Dream, Gen len=128, Win./Block=32, Avg. step=105.52026.05 | 73.2 | — | |
| ED-iDPOBackbone=Qwen2.5-7B-Instruct, Decoding Strategy=Greedy2026.05 | 73 | 0.2 | |
| TRACELOCKModel=LLaDA, Gen len=128, Win./Block=64, Avg. step=88.02026.05 | 73 | — | |
| CoTBackbone=Qwen2.5-7B-Instruct, Decoding Strategy=Greedy2026.05 | 72.8 | — | |
| TRACELOCKModel=Dream, Gen len=128, Win./Block=64, Avg. step=58.42026.05 | 71.5 | — | |
| L2PModel=LLaDA, Gen len=128, Win./Block=64, Avg. step=40.72026.05 | 70.5 | — | |
| ConfidenceModel=Dream, Gen len=128, Win./Block=64, Avg. step=128.02026.05 | 70 | — | |
| Fast-dLLMModel=Dream, Gen len=128, Win./Block=64, Avg. step=87.62026.05 | 69.5 | — | |
| RandomModel=LLaDA, Gen len=256, Win./Block=64, Avg. step=256.02026.05 | 69.1 | — | |
| L2PModel=Dream, Gen len=128, Win./Block=32, Avg. step=117.42026.05 | 69.1 | — | |
| RandomModel=LLaDA, Gen len=128, Win./Block=32, Avg. step=128.02026.05 | 67.1 | — | |
| L2PModel=LLaDA, Gen len=256, Win./Block=128, Avg. step=60.92026.05 | 66.2 | — | |
| L2PModel=Dream, Gen len=256, Win./Block=64, Avg. step=203.52026.05 | 64.6 | — | |
| RandomModel=LLaDA, Gen len=256, Win./Block=128, Avg. step=256.02026.05 | 62.7 | — | |
| RandomModel=LLaDA, Gen len=128, Win./Block=64, Avg. step=128.02026.05 | 62.5 | — | |
| RandomModel=Dream, Gen len=128, Win./Block=32, Avg. step=128.02026.05 | 59.5 | — | |
| ConfidenceModel=Dream, Gen len=256, Win./Block=128, Avg. step=256.02026.05 | 59.4 | — | |
| Fast-dLLMModel=Dream, Gen len=256, Win./Block=128, Avg. step=143.02026.05 | 58.8 | — | |
| L2PModel=Dream, Gen len=128, Win./Block=64, Avg. step=111.22026.05 | 57.3 | — | |
| RandomModel=Dream, Gen len=256, Win./Block=64, Avg. step=256.02026.05 | 51.9 | — | |
| RandomModel=Dream, Gen len=128, Win./Block=64, Avg. step=128.02026.05 | 51.2 | — | |
| RandomModel=Dream, Gen len=256, Win./Block=128, Avg. step=256.02026.05 | 43.2 | — | |
| L2PModel=Dream, Gen len=256, Win./Block=128, Avg. step=139.82026.05 | 24.4 | — |