Mathematics on AIME 2024 (Accuracy)
87.5Accuracypass@32
Evaluation Results
| Method | Links | |
|---|---|---|
| pass@32k=322026.06 | 87.5 | |
| NTele-R1-32B2025.08 | 83.54 | |
| DS-32B-MathDomain=Math2025.08 | 81.87 | |
| DeepSeek-R12025.08 | 79.2 | |
| VP2OContext Length=16K2026.06 | 77.5 | |
| QwQ-32B2025.08 | 76.25 | |
| GRPO-baselineContext Length=16K2026.06 | 75.9 | |
| DS-32B-CodeDomain=Code2025.08 | 73.96 | |
| SCsamples=322026.06 | 72.5 | |
| VP2OContext Length=8K2026.06 | 70.8 | |
| GRPO-baselineContext Length=8K2026.06 | 68.2 | |
| iS@1k=12026.06 | 67.5 | |
| Qwen3-4B-SFT-RLVRParameters=4B, Training=SFT-RLVR2026.06 | 65.83 | |
| DS-32B2025.08 | 65.63 | |
| Qwen3.5-9BParams=9B, Sampling mode=AR2026.06 | 65.56 | |
| FLARE-9BParams=9B, Sampling mode=AR-Trust2026.06 | 63.33 | |
| Qwen3-4BParameters=4B2026.06 | 62.08 | |
| FLARE-9BParams=9B, Sampling mode=Diffusion-Trust2026.06 | 60 | |
| pass@1k=12026.06 | 56.5 | |
| Cog-DRIFTBase Model=Qwen3-4B-Instruct-25072026.04 | 51.74 | |
| Mercury-2Params=Commercial, Sampling mode=Diffusion2026.06 | 51.1 | |
| Zero-shotBase Model=Qwen3-4B-Instruct-25072026.04 | 46.92 | |
| NuRL (Prefix)Base Model=Qwen3-4B-Instruct-25072026.04 | 45.31 | |
| NuRL (Abstract)Base Model=Qwen3-4B-Instruct-25072026.04 | 44.81 | |
| Few-shotBase Model=Qwen3-4B-Instruct-25072026.04 | 44.78 | |
| RFTBase Model=Qwen3-4B-Instruct-25072026.04 | 40.06 | |
| MADBackbone=Llama-3.3-70B-Instruct2025.05 | 33.3 | |
| DyLANBackbone=Llama-3.3-70B-Instruct2025.05 | 33.3 | |
| MAS-GPTBackbone=Llama-3.3-70B-Instruct2025.05 | 33.3 | |
| Qwen3-1.7BParameters=1.7B2026.06 | 32.08 | |
| Qwen3-1.7B-SFT-RLVRParameters=1.7B, Training=SFT-RLVR2026.06 | 32.08 | |
| GRPOBase Model=Qwen3-4B-Instruct-25072026.04 | 31.87 | |
| SCBackbone=Llama-3.3-70B-Instruct2025.05 | 30 | |
| DebateBackbone=Llama-3.3-70B-Instruct2025.05 | 30 | |
| MAVBackbone=Llama-3.3-70B-Instruct2025.05 | 30 | |
| CoTBackbone=Llama-3.3-70B-Instruct2025.05 | 26.7 | |
| MacNetBackbone=Llama-3.3-70B-Instruct2025.05 | 26.7 | |
| AFlow-MathBackbone=Llama-3.3-70B-Instruct2025.05 | 26.7 | |
| SingleBackbone=Llama-3.3-70B-Instruct2025.05 | 23.3 | |
| AgentVerseBackbone=Llama-3.3-70B-Instruct2025.05 | 23.3 | |
| AFlow-MathBackbone=Qwen-2.5-72B-Instruct2025.05 | 23.3 | |
| SimpleRLBackbone=Qwen2.5-7B-Base2026.06 | 20 | |
| ReasonerBackbone=Qwen2.5-7B-Base2026.06 | 20 | |
| TABackbone=Qwen2.5-7B-Base2026.06 | 20 | |
| TIESBackbone=Qwen2.5-7B-Base2026.06 | 20 | |
| DARE + TIESBackbone=Qwen2.5-7B-Base2026.06 | 20 | |
| AutoGenBackbone=Llama-3.3-70B-Instruct2025.05 | 20 | |
| SingleBackbone=Qwen-2.5-72B-Instruct2025.05 | 20 | |
| SCBackbone=Qwen-2.5-72B-Instruct2025.05 | 20 | |
| DebateBackbone=Qwen-2.5-72B-Instruct2025.05 | 20 | |
| MADBackbone=Qwen-2.5-72B-Instruct2025.05 | 20 | |
| DyLANBackbone=Qwen-2.5-72B-Instruct2025.05 | 20 | |
| MAS-GPTBackbone=Qwen-2.5-72B-Instruct2025.05 | 20 | |
| SDAR 30B-A3BParams=30B-A3B, Sampling mode=Diffusion2026.06 | 16.7 | |
| CoTBackbone=Qwen-2.5-72B-Instruct2025.05 | 16.7 | |
| ZeroBackbone=Qwen2.5-7B-Base2026.06 | 16.67 | |
| TSV-MergeBackbone=Qwen2.5-7B-Base2026.06 | 16.67 | |
| ISO-CBackbone=Qwen2.5-7B-Base2026.06 | 16.67 | |
| RAMBackbone=Qwen2.5-7B-Base2026.06 | 16.67 | |
| RESMERGEBackbone=Qwen2.5-7B-Base, configuration=SRC-A+LHC2026.06 | 16.67 | |
| ISO-CTSBackbone=Qwen2.5-7B-Base2026.06 | 13.33 | |
| AutoGenBackbone=Qwen-2.5-72B-Instruct2025.05 | 13.3 | |
| AgentVerseBackbone=Qwen-2.5-72B-Instruct2025.05 | 13.3 | |
| MacNetBackbone=Qwen-2.5-72B-Instruct2025.05 | 10 | |
| OPDLMScale=8B, Inference Mode=Zero-shot, Decoding=Static (one token per step)2026.06 | 7.9 | |
| Qwen2.5-7BBackbone=Qwen2.5-7B-Base2026.06 | 6.67 | |
| MARFTBackbone=LaMAS, Scale=Trio2025.04 | 5.33 | |
| OPDLMScale=4B, Inference Mode=Zero-shot, Decoding=Static (one token per step)2026.06 | 5.3 | |
| Fast-dLLM-v2Scale=7B, Inference Mode=Zero-shot, Decoding=Static (one token per step)2026.06 | 4.3 | |
| NuRL (Abstract)Base Model=Llama3.2-3B-Instruct2026.04 | 4.17 | |
| Cog-DRIFTBase Model=Llama3.2-3B-Instruct2026.04 | 4.17 | |
| IPPO (MAPoRL)Backbone=LaMAS, Scale=Trio2025.04 | 4 | |
| SDARScale=8B, Inference Mode=Zero-shot, Decoding=Static (one token per step)2026.06 | 4 | |
| Zero-shotBase Model=Llama3.2-3B-Instruct2026.04 | 3.75 | |
| Few-shotBase Model=Llama3.2-3B-Instruct2026.04 | 3.33 | |
| NuRL (Prefix)Base Model=Llama3.2-3B-Instruct2026.04 | 3.33 | |
| IPPO (MAPoRL)Backbone=LaMAS, Scale=Duo2025.04 | 3.33 | |
| MARFTBackbone=LaMAS, Scale=Duo2025.04 | 3.33 | |
| MARFTBackbone=LaMAS, Scale=Quad2025.04 | 3.33 | |
| SDARScale=4B, Inference Mode=Zero-shot, Decoding=Static (one token per step)2026.06 | 3 | |
| IPPO (MAPoRL)Backbone=LaMAS, Scale=Quad2025.04 | 2.67 | |
| VanillaBackbone=LaMAS, Scale=Duo2025.04 | 2 | |
| VanillaBackbone=LaMAS, Scale=Trio2025.04 | 2 | |
| VanillaBackbone=LaMAS, Scale=Quad2025.04 | 2 | |
| RFTBase Model=Llama3.2-3B-Instruct2026.04 | 1.67 | |
| GRPOBase Model=Llama3.2-3B-Instruct2026.04 | 0.68 | |
| MAVBackbone=Qwen-2.5-72B-Instruct2025.05 | 0 |