Mathematical Reasoning on AMC (Acc@8, Pass@8)
79.52Acc@8DiPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DiPOBackbone=Qwen3-8B-Base2026.04 | 79.52 | — | |
| DAPO w/ ELBackbone=Qwen3-8B-Base2026.04 | 78.31 | — | |
| GRPOBackbone=Qwen3-8B-Base2026.04 | 77.11 | — | |
| DAPOBackbone=Qwen3-8B-Base2026.04 | 77.11 | — | |
| CDEBackbone=Qwen3-8B-Base2026.04 | 75.9 | — | |
| DiPOBackbone=Qwen3-4B-Base2026.04 | 72.29 | — | |
| DAPOBackbone=Qwen3-4B-Base2026.04 | 69.88 | — | |
| CDEBackbone=Qwen3-4B-Base2026.04 | 69.88 | — | |
| GRPOBackbone=Qwen3-4B-Base2026.04 | 68.67 | — | |
| DAPO w/ ELBackbone=Qwen3-4B-Base2026.04 | 68.67 | — | |
| DAPOBackbone=Qwen2.5-7B2026.04 | 67.47 | — | |
| DiPOBackbone=Qwen2.5-7B2026.04 | 67.47 | — | |
| GRPOBackbone=Qwen2.5-7B2026.04 | 65.06 | — | |
| DAPO w/ ELBackbone=Qwen2.5-7B2026.04 | 63.86 | — | |
| CDEBackbone=Qwen2.5-7B2026.04 | 63.86 | — | |
| Base modelBackbone=Qwen3-8B-Base2026.04 | 59.04 | — | |
| Base modelBackbone=Qwen3-4B-Base2026.04 | 46.99 | — | |
| Base modelBackbone=Qwen2.5-7B2026.04 | 27.71 | — | |
| TTC-NetBackbone=Llama-3-Instruct-7B, Training=SFT2026.03 | 23.34 | 54.22 | |
| + MambaBackbone=Llama-3-Instruct-7B, Memory Module=Mamba, Training=SFT2026.03 | 22.29 | 44.58 | |
| Full FinetuningBackbone=Llama-3-Instruct-7B, Training=SFT2026.03 | 20.78 | 46.98 | |
| + AttentionBackbone=Llama-3-Instruct-7B, Memory Module=Attention, Training=SFT2026.03 | 20.48 | 44.58 | |
| + RetNetBackbone=Llama-3-Instruct-7B, Memory Module=RetNet, Training=SFT2026.03 | 19.58 | 39.76 | |
| + MLPBackbone=Llama-3-Instruct-7B, Memory Module=MLP, Training=SFT2026.03 | 18.67 | 33.73 | |
| + GDNBackbone=Llama-3-Instruct-7B, Memory Module=GDN, Training=SFT2026.03 | 17.77 | 37.35 | |
| + MesaNetBackbone=Llama-3-Instruct-7B, Memory Module=MesaNet, Training=SFT2026.03 | 12.65 | 27.71 | |
| Base modelBackbone=Llama-3-Instruct-7B2026.03 | 6.63 | 31.32 |