Math on AIME 2025 (accuracy (%))
69.9Accuracy (%)VP2O
Evaluation Results
| Method | Links | |
|---|---|---|
| VP2OContext Length=16K2026.06 | 69.9 | |
| GRPO-baselineContext Length=16K2026.06 | 67.8 | |
| LLaDA-2.1-flashParams=100B-A5B, Sampling mode=Diffusion2026.06 | 63.33 | |
| VP2OContext Length=8K2026.06 | 62.5 | |
| LLaDA-2.0-flashParams=100B-A5B, Sampling mode=Diffusion2026.06 | 60 | |
| Qwen3.5-9BParams=9B, Sampling mode=AR2026.06 | 60 | |
| GRPO-baselineContext Length=8K2026.06 | 59.6 | |
| FLARE-9BParams=9B, Sampling mode=AR-Trust2026.06 | 54.44 | |
| FLARE-9BParams=9B, Sampling mode=Diffusion-Trust2026.06 | 53.33 | |
| LLaDA-2.0-miniParams=16B-A1B, Sampling mode=Diffusion2026.06 | 36.67 | |
| LLaDA-2.1-miniParams=16B-A1B, Sampling mode=Diffusion2026.06 | 36.67 | |
| Original (T2T)Backbone=LLaDA2.1-mini, Inference Strategy=Text-to-Text2026.04 | 33.33 | |
| T2MBackbone=LLaDA2.1-mini, Inference Strategy=Token-to-Mask, Remasking Strategy=LOWPROB, τ=0.3, Cmax=1, ρmax=0.252026.04 | 33.33 | |
| TIESBackbone=Qwen2.5-7B-Base2026.06 | 20 | |
| RAMBackbone=Qwen2.5-7B-Base2026.06 | 16.67 | |
| RESMERGEBackbone=Qwen2.5-7B-Base, configuration=SRC-A+LHC2026.06 | 16.67 | |
| DARE + TIESBackbone=Qwen2.5-7B-Base2026.06 | 13.33 | |
| TSV-MergeBackbone=Qwen2.5-7B-Base2026.06 | 13.33 | |
| SDAR 30B-A3BParams=30B-A3B, Sampling mode=Diffusion2026.06 | 10.8 | |
| SimpleRLBackbone=Qwen2.5-7B-Base2026.06 | 10 | |
| ZeroBackbone=Qwen2.5-7B-Base2026.06 | 10 | |
| ReasonerBackbone=Qwen2.5-7B-Base2026.06 | 10 | |
| ISO-CBackbone=Qwen2.5-7B-Base2026.06 | 10 | |
| ISO-CTSBackbone=Qwen2.5-7B-Base2026.06 | 10 | |
| TABackbone=Qwen2.5-7B-Base2026.06 | 3.33 | |
| Qwen2.5-7BBackbone=Qwen2.5-7B-Base2026.06 | 0 |