Mathematical Reasoning on HMMT Nov 2025
94.4AccuracyDeepSeek-V3.2
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| DeepSeek-V3.2variant=Speciale, protocol=Pass@12025.12 | 94.4 | 25 | — | — | |
| GLM-4.72026.07 | 93.5 | — | — | — | |
| Gemini-3.0variant=Pro, protocol=Pass@12025.12 | 93.3 | 15 | — | — | |
| DeepSeek-V3.2variant=Thinking, protocol=Pass@12025.12 | 90.2 | 18 | — | — | |
| GPT-5variant=High, protocol=Pass@12025.12 | 89.2 | 20 | — | — | |
| Kimi-K2variant=Thinking, protocol=Pass@12025.12 | 89.2 | 29 | — | — | |
| GPT-5 High2026.07 | 89.2 | — | — | — | |
| Qwen3-30B-A3B SAOBackbone=Qwen3-30B-A3B, Training/Optimization method=SAO2026.07 | 88.3 | — | — | — | |
| Qwen3-30B-A3B - SAO (w/ DIS only)Backbone=Qwen3-30B-A3B, Training/Optimization method=SAO, DIS mechanism=w/ DIS only2026.07 | 86.7 | — | — | — | |
| Qwen3-30B-A3B - GRPO (+ DIS)Backbone=Qwen3-30B-A3B, Training/Optimization method=GRPO, DIS mechanism=+ DIS2026.07 | 84 | — | — | — | |
| Claude-Sonnet-4.52026.07 | 81.7 | — | — | — | |
| Qwen3-30B-A3B w/o pythonBackbone=Qwen3-30B-A3B, python usage=w/o python2026.07 | 76.7 | — | — | — | |
| Qwen3-30B-A3B GRPO (w/ python)Backbone=Qwen3-30B-A3B, Training/Optimization method=GRPO, python usage=w/ python2026.07 | 76 | — | — | — | |
| Qwen3-30B-A3B SFT (w/ python)Backbone=Qwen3-30B-A3B, Training/Optimization method=SFT, python usage=w/ python2026.07 | 75.2 | — | — | — | |
| ExOPDDistillation Setting=Single-Teacher Distillation2026.02 | 39.3 | — | — | — | |
| ExOPDDistillation Setting=Multi-Teacher Distillation2026.02 | 39.2 | — | — | — | |
| TeacherDistillation Setting=Baseline2026.02 | 38.9 | — | — | — | |
| OPDDistillation Setting=Multi-Teacher Distillation2026.02 | 38.3 | — | — | — | |
| OPDDistillation Setting=Single-Teacher Distillation2026.02 | 37.9 | — | — | — | |
| ExPODistillation Setting=Single-Teacher Distillation2026.02 | 37 | — | — | — | |
| ExPODistillation Setting=Multi-Teacher Distillation2026.02 | 36.3 | — | — | — | |
| SFTDistillation Setting=Multi-Teacher Distillation2026.02 | 34.8 | — | — | — | |
| DelTABackbone=Qwen3-14B-Base, Fine-tuning (FT)=false2026.05 | 32.92 | — | — | — | |
| FIPOBackbone=Qwen3-14B-Base, Fine-tuning (FT)=false2026.05 | 32.29 | — | — | — | |
| DAPOBackbone=Qwen3-14B-Base, Fine-tuning (FT)=true2026.05 | 31.67 | — | — | — | |
| DAPOBackbone=Qwen3-14B-Base, Fine-tuning (FT)=false2026.05 | 30 | — | — | — | |
| SAPOBackbone=Qwen3-14B-Base, Fine-tuning (FT)=false2026.05 | 28.33 | — | — | — | |
| DelTABackbone=Qwen3-8B-Base, Fine-tuning (FT)=false2026.05 | 18.54 | — | — | — | |
| Qwen3-30B-A3B w/ pythonBackbone=Qwen3-30B-A3B, python usage=w/ python2026.07 | 17.3 | — | — | — | |
| Qwen3-30B-A3B SFT (w/o python)Backbone=Qwen3-30B-A3B, Training/Optimization method=SFT, python usage=w/o python2026.07 | 17.3 | — | — | — | |
| SAPOBackbone=Qwen3-8B-Base, Fine-tuning (FT)=false2026.05 | 16.04 | — | — | — | |
| DAPOBackbone=Qwen3-8B-Base, Fine-tuning (FT)=true2026.05 | 15.42 | — | — | — | |
| FIPOBackbone=Qwen3-8B-Base, Fine-tuning (FT)=false2026.05 | 12.92 | — | — | — | |
| DAPOBackbone=Qwen3-8B-Base, Fine-tuning (FT)=false2026.05 | 12.08 | — | — | — | |
| StudentDistillation Setting=Baseline2026.02 | 8 | — | — | — | |
| Gemini-3.0version=Pro2026.02 | 0.945 | 15,000 | — | — | |
| Kimi K2.52026.02 | 0.911 | 24,000 | — | — | |
| DeepSeek-V3.2mode=Thinking2026.02 | 0.902 | 18,000 | — | — | |
| Kimi K2mode=Thinking2026.02 | 0.892 | 32,000 | — | — | |
| BaseBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=5.532026.01 | — | 21.17 | 41.61 | — | |
| BaseModel Family=Qwen3-2507, Model Size=4B2026.05 | — | — | 26.67 | 30 | |
| BaseModel Family=Qwen3-2507, Model Size=8B2026.05 | — | — | 30 | 33.33 | |
| BaseModel Family=Qwen3.5, Model Size=4B2026.05 | — | — | 36.67 | 53.33 | |
| BaseModel Family=Qwen3.5, Model Size=9B2026.05 | — | — | 40 | 60 | |
| DeepSeek-R1-0528-Qwen3-8B# Params=8B, Scale Category=Small to Medium Scale (≤ 70B)2026.03 | — | — | 57.7 | — | |
| DeepSeek-R1-Distill-Llama-70B# Params=70B, Scale Category=Small to Medium Scale (≤ 70B)2026.03 | — | — | 40.2 | — | |
| DS-V3.2 DistillModel Family=Qwen3-2507, Model Size=4B2026.05 | — | — | 23.33 | 30 | |
| DS-V3.2 DistillModel Family=Qwen3-2507, Model Size=8B2026.05 | — | — | 30 | 43.33 | |
| DS-V3.2 DistillModel Family=Qwen3.5, Model Size=4B2026.05 | — | — | 43.33 | 53.33 | |
| DS-V3.2 DistillModel Family=Qwen3.5, Model Size=9B2026.05 | — | — | 43.33 | 60 | |
| Hint-guided RLBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=23.062026.01 | — | 28.56 | 47.27 | — | |
| InT + RLBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=28.832026.01 | — | 33.72 | 49.77 | — | |
| MegaScienceModel Family=Qwen3-2507, Model Size=4B2026.05 | — | — | 26.67 | 33.33 | |
| MegaScienceModel Family=Qwen3-2507, Model Size=8B2026.05 | — | — | 46.67 | 53.33 | |
| MegaScienceModel Family=Qwen3.5, Model Size=4B2026.05 | — | — | 43.33 | 63.33 | |
| MegaScienceModel Family=Qwen3.5, Model Size=9B2026.05 | — | — | 60 | 66.67 | |
| MINDLOOMModel Family=Qwen3-2507, Model Size=4B2026.05 | — | — | 33.33 | 40 | |
| MINDLOOMModel Family=Qwen3-2507, Model Size=8B2026.05 | — | — | 46.67 | 50 | |
| MINDLOOMModel Family=Qwen3.5, Model Size=4B2026.05 | — | — | 53.33 | 60 | |
| MINDLOOMModel Family=Qwen3.5, Model Size=9B2026.05 | — | — | 70 | 76.67 | |
| OpenThoughtModel Family=Qwen3-2507, Model Size=4B2026.05 | — | — | 30 | 40 | |
| OpenThoughtModel Family=Qwen3-2507, Model Size=8B2026.05 | — | — | 43.33 | 50 | |
| OpenThoughtModel Family=Qwen3.5, Model Size=4B2026.05 | — | — | 50 | 66.67 | |
| OpenThoughtModel Family=Qwen3.5, Model Size=9B2026.05 | — | — | 70 | 80 | |
| Qwen3-32B# Params=32B, Scale Category=Small to Medium Scale (≤ 70B)2026.03 | — | — | 50 | — | |
| Qwen3-4B-Thinking-2507# Params=4B, Scale Category=Small to Medium Scale (≤ 70B)2026.03 | — | — | 57.3 | — | |
| Qwen3-4B-Thinking-2507 + CHIMERA# Params=4B, Scale Category=Small to Medium Scale (≤ 70B)2026.03 | — | — | 67 | — | |
| Qwen3-4B-Thinking-2507 + OpenScience# Params=4B, Scale Category=Small to Medium Scale (≤ 70B)2026.03 | — | — | 36.9 | — | |
| RLBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=13.472026.01 | — | 28.26 | 46.46 | — | |
| SFT on ref. solutions + RLBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=19.072026.01 | — | 20.76 | 27.45 | — | |
| SFT on self-reflections + RLBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=23.192026.01 | — | 27.6 | 38.65 | — |