Mathematical Reasoning on AIME 2025 (test)
89.1Pass@1 RateBF16 (Teacher)
Evaluation Results
| Method | Links | ||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| BF16 (Teacher)prompting=Chain-of-thought, sampling=16 samples per problem2026.06 | 89.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenAI-o3Temperature=0.6, top-k=40, top-p=0.95, Maximum token limit=129024, Sampled responses=322026.01 | 88.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CKA-QADprompting=Chain-of-thought, sampling=16 samples per problem2026.06 | 88.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QAD (KL-only)prompting=Chain-of-thought, sampling=16 samples per problem2026.06 | 87.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-R1-0528Temperature=0.6, top-k=40, top-p=0.95, Maximum token limit=129024, Sampled responses=322026.01 | 87.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PCL-Reasoner-V1.5Temperature=0.6, top-k=40, top-p=0.95, Maximum token limit=129024, Sampled responses=322026.01 | 85.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NVFP4 PTQprompting=Chain-of-thought, sampling=16 samples per problem2026.06 | 85 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PCL-Reasoner-V1Temperature=0.6, top-k=40, top-p=0.95, Maximum token limit=129024, Sampled responses=322026.01 | 84.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenReasoning-NemotronTemperature=0.6, top-k=40, top-p=0.95, Maximum token limit=129024, Sampled responses=322026.01 | 84 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini-2.5-Pro-0506Temperature=0.6, top-k=40, top-p=0.95, Maximum token limit=129024, Sampled responses=322026.01 | 83 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-235B-A22BTemperature=0.6, top-k=40, top-p=0.95, Maximum token limit=129024, Sampled responses=322026.01 | 81.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-235B-A22B2025.08 | 81.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-32B-InstructDataset Size=1K, Training Method=SFT, Strategy=Majority Vote (S-D D-S R-R)2025.08 | 80 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-Qwen-32BDataset Size=1K, Training Method=SFT, Strategy=D-S2025.08 | 80 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-Qwen-32BDataset Size=1K, Training Method=SFT, Strategy=Majority Vote (D-S S-S S-S)2025.08 | 80 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-Qwen-32BDataset Size=1K, Training Method=SFT, Strategy=Majority Vote (R-S D-R S-S)2025.08 | 80 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenAI-o12025.08 | 79.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Grok-3-Beta(Think)2025.08 | 77.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-32B-InstructDataset Size=1K, Training Method=SFT, Strategy=Merge2025.08 | 76.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-32B-InstructDataset Size=1K, Training Method=SFT, Strategy=Majority Vote (S-D D-S R-S)2025.08 | 76.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenAI-o3-mini(medium)2025.08 | 74.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AM-Thinking-v1Temperature=0.6, top-k=40, top-p=0.95, Maximum token limit=129024, Sampled responses=322026.01 | 74.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoNLBackbone=Qwen3-8B, Training Required=true2026.01 | 73.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Skywork-OR1-32BTemperature=0.6, top-k=40, top-p=0.95, Maximum token limit=129024, Sampled responses=322026.01 | 73.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-32B-InstructDataset Size=1K, Training Method=SFT, Strategy=D-S2025.08 | 73.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-Qwen-32BDataset Size=1K, Training Method=SFT, Strategy=S-S2025.08 | 73.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-Qwen-32BDataset Size=1K, Training Method=SFT, Strategy=R-D2025.08 | 73.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-32B2025.08 | 72.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Large ModelModel Pair=Qwen3-32 / 1.7B2026.02 | 70 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-R1Temperature=0.6, top-k=40, top-p=0.95, Maximum token limit=129024, Sampled responses=322026.01 | 70 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-R12025.08 | 70 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-32B-InstructDataset Size=1K, Training Method=SFT, Strategy=S-D2025.08 | 70 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QwQ-32BTemperature=0.6, top-k=40, top-p=0.95, Maximum token limit=129024, Sampled responses=322026.01 | 69.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QwQ-32BTraining Method=RL2025.08 | 69.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RelayGenModel Pair=Qwen3-32 / 1.7B2026.02 | 68.33 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Skywork-OR1-32B-PreviewDataset Size=124K, Training Method=RL2025.08 | 68.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoNLBackbone=Qwen3-4B-Instruct, Training Required=true2026.01 | 67.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MiroMind-M1-RL-32BDataset Size=62K, Training Method=RL2025.08 | 65.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| R2RModel Pair=Qwen3-32 / 1.7B2026.02 | 62.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| 0-Shot InferenceBackbone=Qwen3-8B, Training Required=false2026.01 | 60 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenThinker2-32BDataset Size=1000K, Training Method=SFT2025.08 | 58.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Power asym (2,2)Backbone=CWM 32B, Training Budget=30k2026.07 | 58.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.1 | 83.3 | |
| PPCVBase Model=DeepSeek-R1-Distill-Llama-70B2026.02 | 56.66 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-Llama-70BDataset Size=800K, Training Method=SFT2025.08 | 56.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Large ModelModel Pair=R1-Distill-Qwen-32B / R1-Distill-Qwen-1.5B2026.02 | 53.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Asym FADEBackbone=CWM 32B, Training Budget=30k, h*=1.02026.07 | 52.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.5 | 83.1 | |
| R2RModel Pair=R1-Distill-Qwen-32B / R1-Distill-Qwen-1.5B2026.02 | 52.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-Qwen-32BDataset Size=800K, Training Method=SFT2025.08 | 52.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RelayGenModel Pair=R1-Distill-Qwen-32B / R1-Distill-Qwen-1.5B2026.02 | 50 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-R1-Distill-Qwen-32BTemperature=0.6, top-k=40, top-p=0.95, Maximum token limit=129024, Sampled responses=322026.01 | 49.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LIMO-32BDataset Size=1k, Training Method=SFT2025.08 | 49.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| S1.1-32BDataset Size=1k, Training Method=SFT2025.08 | 49.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenThinker-32BDataset Size=114k, Training Method=SFT2025.08 | 49.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Phi-DecodingBase Model=DeepSeek-R1-Distill-Llama-70B2026.02 | 46.67 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GRPOBackbone=CWM 32B, Training Budget=30k2026.07 | 46.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | 77.2 | 80 | |
| Speculative ThinkingModel Pair=Qwen3-32 / 1.7B2026.02 | 40.83 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Predictive DecodingBase Model=DeepSeek-R1-Distill-Llama-70B2026.02 | 40.66 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-Qwen-32BDataset Size=800K, Training Method=SFT, Decoding Strategy=Greedy Decoding2025.08 | 40 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Chain-of-ThoughtBase Model=DeepSeek-R1-Distill-Llama-70B2026.02 | 38 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIP-Cov + QAEModel=Qwen3-8B-Base2025.09 | 37.4 | — | 56.29 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| 2d_heteroBudget (b)=2562026.04 | 36.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DYNTSBackbone=R1-Qwen2026.01 | 36.6 | 643 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TransformersBackbone=R1-Qwen2026.01 | 35.3 | 354.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Clip-Higher + QAEModel=Qwen3-8B-Base2025.09 | 34.9 | — | 57.92 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| KL-Cov + QAEModel=Qwen3-8B-Base2025.09 | 33.44 | — | 51.62 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| KL-CovModel=Qwen3-8B-Base2025.09 | 33.33 | — | 45.86 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| H2OBackbone=R1-Qwen2026.01 | 33.3 | 610.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SnapKVBackbone=R1-Qwen2026.01 | 33.3 | 633.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| 2d_heteroBudget (b)=5122026.04 | 33.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIP-CovModel=Qwen3-8B-Base2025.09 | 33.02 | — | 52.27 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Clip-HigherModel=Qwen3-8B-Base2025.09 | 32.71 | — | 56.66 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| R-KVBackbone=R1-Qwen2026.01 | 32.6 | 634.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GSPO + QAEModel=Qwen3-30B-A3B-Base2025.09 | 32.5 | — | 48.01 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Small ModelModel Pair=Qwen3-32 / 1.7B2026.02 | 31.67 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| WindowBackbone=R1-Qwen2026.01 | 31.3 | 643 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SepLLMBackbone=R1-Qwen2026.01 | 31.3 | 647.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FADEBackbone=Qwen 2.5 7B SFT, Training Budget=14k, h*=1.32026.07 | 31.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | 55.4 | 70.7 | |
| GSPOModel=Qwen3-30B-A3B-Base2025.09 | 31.15 | — | 46.59 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Speculative ThinkingModel Pair=R1-Distill-Qwen-32B / R1-Distill-Qwen-1.5B2026.02 | 30 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| fullBudget (b)=unlimited2026.04 | 30 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| 2d_uniformBudget (b)=5122026.04 | 30 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| 2d_heteroBudget (b)=642026.04 | 30 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DYNTSBackbone=R1-Llama2026.01 | 29.3 | 443.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| StreamingLLMBackbone=R1-Qwen2026.01 | 29.3 | 648.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TransformersBackbone=R1-Llama2026.01 | 28.6 | 213.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FADEBackbone=Qwen 2.5 7B SFT, Training Budget=14k, h*=1.02026.07 | 28.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | 53.8 | 68.3 | |
| Small ModelModel Pair=R1-Distill-Qwen-32B / R1-Distill-Qwen-1.5B2026.02 | 28.33 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FADEBackbone=Qwen 2.5 7B SFT, Training Budget=14k, h*=0.52026.07 | 27.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | 52.9 | 67.5 | |
| Implicit p@8Backbone=Qwen 2.5 7B SFT, Training Budget=14k2026.07 | 27.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | 52.5 | 69.1 | |
| Asym. normBackbone=Qwen 2.5 7B SFT, Training Budget=14k2026.07 | 27.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | 52 | 63.3 | |
| Power α asym (2,2)Backbone=Qwen 2.5 7B SFT, Training Budget=14k2026.07 | 27.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | 53.3 | 66.6 | |
| Power α = 2Backbone=CWM 32B, Training Budget=30k2026.07 | 27.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.4 | 84.6 | |
| 2d_heteroBudget (b)=1282026.04 | 26.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Asym. GRPOBackbone=Qwen 2.5 7B SFT, Training Budget=14k, delta=0.52026.07 | 26.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | 48.3 | 66 | |
| Power α = 2Backbone=Qwen 2.5 7B SFT, Training Budget=14k2026.07 | 26.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | 50 | 64.9 | |
| R-KVBackbone=R1-Llama2026.01 | 26 | 434.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LMEBackbone=Qwen 2.5 7B SFT, Training Budget=14k, beta=0.42026.07 | 25.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | 51 | 72.5 | |
| S1-32BDataset Size=1k, Training Method=SFT2025.08 | 25.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RLADModel=Qwen2.5-1.5B-DS, Context=8K2026.02 | 25.1 | — | — | — | 47.1 | — | — | — | — | — | — | — | — | — | — | — | |
| Implicit p@2Backbone=Qwen 2.5 7B SFT, Training Budget=14k2026.07 | 24.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | 45 | 63.7 |