Mathematical Reasoning on AIME 2025 (Pass@1 Accuracy)
98.6Pass@1 AccuracyNemotron-Cascade-2 30B-A3B
Evaluation Results
| Method | Links | |
|---|---|---|
| Nemotron-Cascade-2 30B-A3BTool-Integrated Reasoning (TIR)=true2026.03 | 98.6 | |
| Nemotron-Cascade-2 30B-A3B2026.03 | 92.4 | |
| Qwen3.5 35B-A3BOfficial/Recommended Settings=true2026.03 | 91.9 | |
| Nemotron-3-Super 120B-A12B2026.03 | 90.2 | |
| Nemotron-3-Nano 30B-A3B2026.03 | 89.1 | |
| SeLaRBackbone=Qwen3-8B2026.04 | 80 | |
| SeLaRBackbone=Qwen3-32B2026.04 | 80 | |
| CAPSModel=Qwen3-14B, N=16, Temperature=1.02026.05 | 80 | |
| V1-InferModel=Qwen3-14B, N=16, Temperature=1.02026.05 | 76.7 | |
| V1-InferModel=Qwen3-4B-Instruct-2507, N=16, Temperature=1.02026.05 | 76.7 | |
| SwiRBackbone=Qwen3-32B2026.04 | 73.75 | |
| CoTBackbone=Qwen3-32B, Decoding Strategy=Greedy2026.04 | 73.33 | |
| Mem2EvolveBackbone=GPT-5-Chat2026.04 | 73.33 | |
| PointwiseModel=Qwen3-14B, N=16, Temperature=1.02026.05 | 73.3 | |
| CAPSModel=Qwen3-4B-Instruct-2507, N=16, Temperature=1.02026.05 | 73.3 | |
| CoTBackbone=Qwen3-32B, Decoding Strategy=Sampling2026.04 | 72.08 | |
| VanillaModel=Qwen3-14B, N=16, Temperature=1.02026.05 | 70.4 | |
| PointwiseModel=Qwen3-4B-Instruct-2507, N=16, Temperature=1.02026.05 | 70 | |
| Qwen3-32BStudent Model=-, Teacher Model=Qwen3-32B, Method=Base2026.05 | 68.33 | |
| CoTBackbone=Qwen3-8B, Decoding Strategy=Sampling2026.04 | 66.67 | |
| Soft ThinkingBackbone=Qwen3-8B2026.04 | 66.67 | |
| SwiRBackbone=Qwen3-8B2026.04 | 66.67 | |
| AlitaBackbone=GPT-5-Chat2026.04 | 66.67 | |
| VanillaModel=Qwen3-4B-Instruct-2507, N=16, Temperature=1.02026.05 | 66.6 | |
| Soft ThinkingBackbone=Qwen3-32B2026.04 | 66.25 | |
| OmniOPDStudent Model=Qwen3-4B, Teacher Model=Claude-4.5-haiku, Method=OmniOPD2026.05 | 65.63 | |
| Gemini-2.5-flashStudent Model=-, Teacher Model=Gemini-2.5-flash, Method=Base2026.05 | 65.2 | |
| OmniOPDStudent Model=Qwen3-4B, Teacher Model=Gemini-2.5-flash, Method=OmniOPD2026.05 | 64.37 | |
| CoTBackbone=Qwen3-8B, Decoding Strategy=Greedy2026.04 | 63.33 | |
| AFLOWBackbone=GPT-5-Chat2026.04 | 63.33 | |
| SFTStudent Model=Qwen3-4B, Teacher Model=Gemini-2.5-flash, Method=SFT2026.05 | 63.13 | |
| OmniOPDStudent Model=Qwen3-4B, Teacher Model=Qwen3-30B-A3B-Inst., Method=OmniOPD2026.05 | 62.92 | |
| Qwen3-4B (GRPO)Student Model=Qwen3-4B, Teacher Model=-, Method=GRPO2026.05 | 60.7 | |
| OmniOPDStudent Model=Qwen3-4B, Teacher Model=Qwen3-32B, Method=OmniOPD2026.05 | 60.42 | |
| OPDStudent Model=Qwen3-4B, Teacher Model=Qwen3-32B, Method=OPD2026.05 | 60.25 | |
| GPT-5-Chat (ReAct)Backbone=GPT-5-Chat2026.04 | 60 | |
| SFTStudent Model=Qwen3-4B, Teacher Model=Qwen3-32B, Method=SFT2026.05 | 58.95 | |
| CAPSModel=Qwen3-4B-Thinking-2507, N=16, Temperature=1.02026.05 | 56.7 | |
| GPT-5-Chat (CoT)Backbone=GPT-5-Chat2026.04 | 56.67 | |
| SFTStudent Model=Qwen3-4B, Teacher Model=Claude-4.5-haiku, Method=SFT2026.05 | 53.33 | |
| V1-InferModel=Qwen3-4B-Thinking-2507, N=16, Temperature=1.02026.05 | 53.3 | |
| DSPyBackbone=GPT-5-Chat2026.04 | 50 | |
| AgentVerseBackbone=GPT-5-Chat2026.04 | 50 | |
| CAPSModel=GPT-OSS-20B, N=16, Temperature=1.02026.05 | 50 | |
| PointwiseModel=Qwen3-4B-Thinking-2507, N=16, Temperature=1.02026.05 | 46.7 | |
| V1-InferModel=GPT-OSS-20B, N=16, Temperature=1.02026.05 | 46.7 | |
| GPT-5-Chat (Direct)Backbone=GPT-5-Chat2026.04 | 46.67 | |
| Qwen3-30B-A3B-Inst.Student Model=-, Teacher Model=Qwen3-30B-A3B-Inst., Method=Base2026.05 | 44.79 | |
| Qwen3-1.7B (GRPO)Student Model=Qwen3-1.7B, Teacher Model=-, Method=GRPO2026.05 | 44.45 | |
| VanillaModel=Qwen3-4B-Thinking-2507, N=16, Temperature=1.02026.05 | 43.7 | |
| DyLANBackbone=GPT-5-Chat2026.04 | 43.33 | |
| EvoAgentBackbone=GPT-5-Chat2026.04 | 43.33 | |
| Qwen3-4BStudent Model=Qwen3-4B, Teacher Model=-, Method=Base2026.05 | 41.88 | |
| HEALModels=Qwen2.5-14B-Instruct2026.03 | 40.17 | |
| SwarmAgenticBackbone=GPT-5-Chat2026.04 | 40 | |
| PointwiseModel=GPT-OSS-20B, N=16, Temperature=1.02026.05 | 40 | |
| OPDStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-32B, Method=OPD2026.05 | 37.58 | |
| SFPOModel=DS-distilled-Qwen-7B2025.10 | 37.5 | |
| Qwen3-1.7BStudent Model=Qwen3-1.7B, Teacher Model=-, Method=Base2026.05 | 37.5 | |
| VanillaModel=GPT-OSS-20B, N=16, Temperature=1.02026.05 | 37.4 | |
| OPDStudent Model=Qwen3-4B, Teacher Model=Qwen3-30B-A3B-Inst., Method=OPD2026.05 | 36.87 | |
| Soft ThinkingBackbone=Qwen3-1.7B2026.04 | 36.67 | |
| SeLaRBackbone=Qwen3-1.7B2026.04 | 36.67 | |
| AutoAgentsBackbone=GPT-5-Chat2026.04 | 36.67 | |
| GRPOModel=DS-distilled-Qwen-7B2025.10 | 35.83 | |
| Claude-4.5-haikuStudent Model=-, Teacher Model=Claude-4.5-haiku, Method=Base2026.05 | 34.79 | |
| Curriculum SFTModels=Qwen2.5-14B-Instruct2026.03 | 33.33 | |
| CoTBackbone=Qwen3-1.7B, Decoding Strategy=Sampling2026.04 | 33.33 | |
| OmniOPDStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-32B, Method=OmniOPD2026.05 | 33.33 | |
| HEALModels=Qwen3-4B-Base2026.03 | 33.23 | |
| SFTStudent Model=Qwen3-4B, Teacher Model=Qwen3-30B-A3B-Inst., Method=SFT2026.05 | 31.04 | |
| SFPOModel=DS-distilled-Qwen-1.5B2025.10 | 30.83 | |
| SFTStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-32B, Method=SFT2026.05 | 30.2 | |
| CoTBackbone=Qwen3-1.7B, Decoding Strategy=Greedy2026.04 | 30 | |
| EvoMemBackbone=Qwen3-8B, Team size (k)=32026.05 | 30 | |
| EVOCHAMBERBackbone=Qwen3-8B, Team size (k)=32026.05 | 30 | |
| SFTModels=Qwen2.5-14B-Instruct2026.03 | 29.53 | |
| NFPOBase Model=Qwen3-8B-Base, Algorithm=NFPO2026.05 | 28.4 | |
| AgentNetBackbone=Qwen3-8B, Team size (k)=32026.05 | 26.7 | |
| DPPOBase Model=Qwen3-8B-Base, Algorithm=DPPO2026.05 | 25.6 | |
| BaseModel=DS-distilled-Qwen-7B2025.10 | 25 | |
| GRPOModel=DS-distilled-Qwen-1.5B2025.10 | 23.33 | |
| SwiRBackbone=Qwen3-1.7B2026.04 | 23.33 | |
| MemCollabBackbone=Qwen3-8B, Team size (k)=32026.05 | 23.3 | |
| CERBackbone=Qwen3-8B-Base, Training Dataset=mathematical dataset2026.03 | 23.1 | |
| GRPOBase Model=Qwen3-8B-Base, Algorithm=GRPO2026.05 | 22.9 | |
| Rule-basedBackbone=Qwen3-8B-Base, Training Dataset=mathematical dataset2026.03 | 22.7 | |
| LIMOModels=Qwen3-4B-Base2026.03 | 22.13 | |
| General-verifierBackbone=Qwen3-8B-Base, Reward Method=General-verifier, Training Data Domain=General-domain2026.03 | 21.7 | |
| Rule-basedBackbone=Qwen3-4B-Base, Training Dataset=mathematical dataset2026.03 | 21.5 | |
| CERBackbone=Qwen3-4B-Base, Reward Method=CER, Training Data Domain=General-domain2026.03 | 21.3 | |
| Rule-basedBackbone=Qwen3-8B-Base, Reward Method=Rule-based, Training Data Domain=General-domain2026.03 | 21 | |
| Rule+CERBackbone=Qwen3-8B-Base, Training Dataset=mathematical dataset2026.03 | 21 | |
| GRPOModel=Qwen2.5-Math-7B2025.10 | 20.83 | |
| SFPOModel=Qwen2.5-Math-7B2025.10 | 20.83 | |
| SFPOModel=Qwen3-4B-Base2025.10 | 20.83 | |
| Rule+CERBackbone=Qwen3-4B-Base, Training Dataset=mathematical dataset2026.03 | 20.8 | |
| Exact-MatchBackbone=Qwen3-4B-Base, Reward Method=Exact-Match, Training Data Domain=General-domain2026.03 | 20.6 | |
| CERBackbone=Qwen3-8B-Base, Reward Method=CER, Training Data Domain=General-domain2026.03 | 20.6 | |
| Rule+CERBackbone=Qwen3-8B-Base, Reward Method=Rule+CER, Training Data Domain=General-domain2026.03 | 20.6 |