Mathematical Reasoning on MATH (Exact Match, Avg, ΔScore)
87Exact Match AccuracyWORC+AC
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| WORC+AC2026.04 | 87 | — | — | |
| AoT2026.04 | 83.6 | — | — | |
| AFlow2026.04 | 83 | — | — | |
| FoTn (sampling size)=82026.04 | 82.5 | — | — | |
| CoT-SCn (sampling size)=52026.04 | 81.8 | — | — | |
| AgentChain2026.04 | 81 | — | — | |
| Self-Refine2026.04 | 78.7 | — | — | |
| CoT2026.04 | 78.3 | — | — | |
| High Prediction Entropy-onlyBackbone=Qwen3-8B-Base2026.05 | 74.41 | — | — | |
| Entropy reweightingBackbone=Qwen3-8B-Base, Layer=Mid (Layer 20)2026.05 | 74.15 | — | — | |
| Entropy reweightingBackbone=Qwen3-8B-Base, Layer=Shallow (Layer 8)2026.05 | 73.88 | — | — | |
| Entropy reweightingBackbone=Qwen3-8B-Base, Layer=Deep (Layer 31)2026.05 | 73.54 | — | — | |
| Full-token DAPOBackbone=Qwen3-8B-Base2026.05 | 71.8 | — | — | |
| Explorer-only, successful seeds (diagnostic)Backbone=Qwen3-8B-Base2026.05 | 70.98 | — | — | |
| Random-20%Backbone=Qwen3-8B-Base2026.05 | 70.91 | — | — | |
| DASDBase Model=Qwen3-4B2026.05 | 70.2 | 74.3 | — | |
| Mask-PPLBase Model=Qwen3-4B2026.05 | 69.2 | 71.1 | — | |
| Hint-decodingBase Model=Qwen3-4B2026.05 | 68.4 | 71.6 | — | |
| Self-DistillationBase Model=Qwen3-4B2026.05 | 67 | 69.7 | — | |
| Anchor-onlyBackbone=Qwen3-8B-Base2026.05 | 66.43 | — | — | |
| Analogical Prompting2026.04 | 65.4 | — | — | |
| OriginBase Model=Qwen3-4B2026.05 | 63 | 70.8 | — | |
| MemRewardBackbone=Qwen2.5-3B-Instruct, Supervision Paradigm=20% GT + GNN2026.03 | 61.11 | 77.02 | -2.1 | |
| R1-OracleBackbone=Qwen2.5-3B-Instruct, Supervision Paradigm=100% GT2026.03 | 60.33 | 79.12 | 0 | |
| R1-pBackbone=Qwen2.5-3B-Instruct, Supervision Paradigm=20% GT2026.03 | 54.67 | 75.67 | -3.45 | |
| R1-OracleBackbone=Qwen2.5-1.5B-Instruct, Supervision Paradigm=100% GT2026.03 | 53.11 | 70.47 | 0 | |
| MemRewardBackbone=Qwen2.5-1.5B-Instruct, Supervision Paradigm=20% GT + GNN2026.03 | 50.89 | 68.1 | -2.37 | |
| Explorer-only, all seedsBackbone=Qwen3-8B-Base2026.05 | 46.79 | — | — | |
| R1-pBackbone=Qwen2.5-1.5B-Instruct, Supervision Paradigm=20% GT2026.03 | 44.44 | 62.72 | -7.75 | |
| Hint-decodingBase Model=Llama3.2-3B2026.05 | 41.8 | 56.3 | — | |
| DASDBase Model=Llama3.2-3B2026.05 | 41.6 | 56.7 | — | |
| Mask-PPLBase Model=Llama3.2-3B2026.05 | 38.8 | 54.7 | — | |
| Self-DistillationBase Model=Llama3.2-3B2026.05 | 38.4 | 53.1 | — | |
| OriginBase Model=Llama3.2-3B2026.05 | 36 | 52.3 | — | |
| DASDBase Model=Gemma2-2B2026.05 | 27.4 | 47 | — | |
| Hint-decodingBase Model=Gemma2-2B2026.05 | 26.2 | 45.9 | — | |
| Self-DistillationBase Model=Gemma2-2B2026.05 | 24.8 | 44.8 | — | |
| Mask-PPLBase Model=Gemma2-2B2026.05 | 24.8 | 45.4 | — | |
| OriginBase Model=Gemma2-2B2026.05 | 22 | 43 | — |