Mathematical Reasoning on HMMT25 (Accuracy (%))
92.5Accuracy (%)TRICE-30B
Evaluation Results
| Method | Links | |
|---|---|---|
| TRICE-30BTool Use=Yes2026.05 | 92.5 | |
| DeepSeek-V3.2-ThinkingTool Use=No2026.05 | 90.8 | |
| Qwen3-235B-A22B-ThinkingTool Use=No2026.05 | 88.8 | |
| GSPO + IBPO(mask)Model=Qwen3-Next2026.04 | 81.1 | |
| GSPO + IBPOModel=Qwen3-Next2026.04 | 80.4 | |
| GSPO + IBPO(ratio)Model=Qwen3-Next2026.04 | 80 | |
| GSPO with Best-of-NModel=Qwen3-Next, N=82026.04 | 77.2 | |
| GSPO with promptModel=Qwen3-Next2026.04 | 76.5 | |
| GSPO with SCoReModel=Qwen3-Next2026.04 | 76.3 | |
| GSPOModel=Qwen3-Next2026.04 | 75.9 | |
| ParaManagerOrchestration Strategy=Unified2026.04 | 63.33 | |
| GSPO + IBPO(mask)Model=Qwen3-32B2026.04 | 63.1 | |
| GSPO + IBPOModel=Qwen3-32B2026.04 | 62.6 | |
| GSPO + IBPO(ratio)Model=Qwen3-32B2026.04 | 62.2 | |
| ParaManager-SerialOrchestration Strategy=Serial2026.04 | 60 | |
| ToolOrchestraOrchestration Strategy=Serial Orchestration2026.04 | 58.33 | |
| GSPO with Best-of-NModel=Qwen3-32B, N=82026.04 | 57.1 | |
| PuppeteerOrchestration Strategy=Serial Orchestration2026.04 | 57.08 | |
| GSPO with SCoReModel=Qwen3-32B2026.04 | 56.7 | |
| GPT-OSS-20BOrchestration Strategy=Base+Tool2026.04 | 56.67 | |
| GPT-OSS-20BOrchestration Strategy=Majority Vote2026.04 | 56.67 | |
| ParaManager-SFTOrchestration Strategy=SFT2026.04 | 56.67 | |
| GSPO with promptModel=Qwen3-32B2026.04 | 56.4 | |
| GSPOModel=Qwen3-32B2026.04 | 55.6 | |
| CL-EGRSDBackbone=Qwen3-8B2026.05 | 52.5 | |
| GPT-OSS-20BOrchestration Strategy=Self Refine2026.04 | 52.08 | |
| EvoFlowOrchestration Strategy=Static Workflow2026.04 | 52.08 | |
| ParaManager-MonoOrchestration Strategy=Mono2026.04 | 50 | |
| KnowRL-Nemotron-1.5BHint Setting=CSS, Evaluation Protocol=mean@322026.04 | 48.75 | |
| RouterOrchestration Strategy=Static Workflow2026.04 | 47.92 | |
| GPT-OSS-20BOrchestration Strategy=Base2026.04 | 47.5 | |
| SFTBackbone=Qwen3-8B2026.05 | 46.67 | |
| OPSDBackbone=Qwen3-8B2026.05 | 45.84 | |
| EGRSDBackbone=Qwen3-8B2026.05 | 45.42 | |
| Baseline (no-train)Backbone=Qwen3-8B2026.05 | 45.1 | |
| KnowRL-Nemotron-1.5BHint Setting=CBRS, Evaluation Protocol=mean@322026.04 | 45 | |
| QuestAHint Setting=CSS, Evaluation Protocol=mean@322026.04 | 44.35 | |
| Meta Agent SearchOrchestration Strategy=Static Workflow2026.04 | 44.17 | |
| QuestAHint Setting=CBRS, Evaluation Protocol=mean@322026.04 | 43.78 | |
| Qwen3-30B A3B-Instruct-2507Orchestration Strategy=Self Refine2026.04 | 43.75 | |
| Qwen3-30B A3B-Instruct-2507Orchestration Strategy=Base+Tool2026.04 | 43.33 | |
| Qwen3-30B A3B-Instruct-2507Orchestration Strategy=Majority Vote2026.04 | 43.33 | |
| CRISPBackbone=Qwen3-8B2026.05 | 42.92 | |
| Qwen3-30B A3B-Instruct-2507Orchestration Strategy=Base2026.04 | 42.5 | |
| JustRLHint Setting=CBRS, Evaluation Protocol=mean@322026.04 | 41.81 | |
| GRPOBackbone=Qwen3-8B2026.05 | 41.67 | |
| JustRLHint Setting=CSS, Evaluation Protocol=mean@322026.04 | 41.54 | |
| KnowRL-Nemotron-1.5BHint Setting=w/o KP, Evaluation Protocol=mean@322026.04 | 41.04 | |
| QuestAHint Setting=w/o KP, Evaluation Protocol=mean@322026.04 | 40.94 | |
| JustRLHint Setting=w/o KP, Evaluation Protocol=mean@322026.04 | 40.63 | |
| Qwen3-4B Instruct-2507Orchestration Strategy=Majority Vote2026.04 | 40 | |
| Qwen3-4B Instruct-2507Orchestration Strategy=Self Refine2026.04 | 37.5 | |
| Nemotron-1.5BHint Setting=CSS, Evaluation Protocol=mean@322026.04 | 35.77 | |
| Nemotron-1.5BHint Setting=CBRS, Evaluation Protocol=mean@322026.04 | 34.79 | |
| Qwen3-4B Instruct-2507Orchestration Strategy=Base2026.04 | 34.17 | |
| Qwen3-4B Instruct-2507Orchestration Strategy=Base+Tool2026.04 | 34.17 | |
| Nemotron-1.5BHint Setting=w/o KP, Evaluation Protocol=mean@322026.04 | 30.63 | |
| Qwen3-Coder 30B-A3B-InstructOrchestration Strategy=Base+Tool2026.04 | 23.33 | |
| ARM + MPFoundation Model=GPT-4.1-nano2025.10 | 22.4 | |
| DGO (TTS)Model=Qwen3-14B-Base, Inference Mode=Test-Time Scaling2026.03 | 22.29 | |
| LLM-DebateFoundation Model=GPT-4.1-nano2025.10 | 16.7 | |
| DGO (TTS)Model=Qwen3-4B-Base, Inference Mode=Test-Time Scaling2026.03 | 15.83 | |
| DGO (zero)Model=Qwen3-14B-Base, Inference Mode=Intrinsic Inference2026.03 | 15.21 | |
| ARMFoundation Model=GPT-4.1-nano2025.10 | 14.6 | |
| DGO (TTS)Model=Qwen3-8B-Base, Inference Mode=Test-Time Scaling2026.03 | 14.37 | |
| GRPOModel=Qwen3-14B-Base2026.03 | 14.37 | |
| DAPOModel=Qwen3-14B-Base2026.03 | 14.17 | |
| CoT-SCFoundation Model=GPT-4.1-nano2025.10 | 13.5 | |
| Qwen3-Coder 30B-A3B-InstructOrchestration Strategy=Majority Vote2026.04 | 13.33 | |
| Qwen3-Coder 30B-A3B-InstructOrchestration Strategy=Self Refine2026.04 | 12.5 | |
| AFlowFoundation Model=GPT-4.1-nano, Evaluation Setup=test set2025.10 | 12 | |
| DGO (zero)Model=Qwen3-8B-Base, Inference Mode=Intrinsic Inference2026.03 | 11.88 | |
| DGO (zero)Model=Qwen3-4B-Base, Inference Mode=Intrinsic Inference2026.03 | 11.67 | |
| Qwen3-Coder 30B-A3B-InstructOrchestration Strategy=Base2026.04 | 10.83 | |
| AFlowFoundation Model=GPT-4.1-nano, Evaluation Setup=1000-sample2025.10 | 10.4 | |
| CoTFoundation Model=GPT-4.1-nano2025.10 | 9.9 | |
| Self-RefineFoundation Model=GPT-4.1-nano2025.10 | 9.4 | |
| ARM + MPFoundation Model=GPT-4o2025.10 | 9.4 | |
| DAPOModel=Qwen3-4B-Base2026.03 | 9.17 | |
| GRPOModel=Qwen3-8B-Base2026.03 | 9.17 | |
| DAPOModel=Qwen3-8B-Base2026.03 | 9.17 | |
| GRPOModel=Qwen3-4B-Base2026.03 | 8.75 | |
| ConSPOBackbone=Qwen3-4B-Base2026.05 | 8 | |
| ADASFoundation Model=GPT-4.1-nano, Evaluation Setup=1000-sample2025.10 | 6.8 | |
| ARM + MPFoundation Model=LLaMA-3.3-70B2025.10 | 6.8 | |
| SFTModel=Qwen3-14B-Base2026.03 | 6.46 | |
| ARMFoundation Model=GPT-4o2025.10 | 5.7 | |
| CoT-SCFoundation Model=LLaMA-3.3-70B2025.10 | 5.7 | |
| DisCOBackbone=Qwen3-4B-Base2026.05 | 5.3 | |
| ADASFoundation Model=GPT-4.1-nano, Evaluation Setup=test set2025.10 | 5.2 | |
| ARMFoundation Model=LLaMA-3.3-70B2025.10 | 5.2 | |
| Self-RefineFoundation Model=LLaMA-3.3-70B2025.10 | 4.2 | |
| LLM-DebateFoundation Model=LLaMA-3.3-70B2025.10 | 4.2 | |
| AFlowFoundation Model=GPT-4o, Evaluation Setup=test set2025.10 | 3.6 | |
| SFTModel=Qwen3-8B-Base2026.03 | 3.54 | |
| LLM-DebateFoundation Model=GPT-4o2025.10 | 3.1 | |
| CoTFoundation Model=LLaMA-3.3-70B2025.10 | 3.1 | |
| AFlowFoundation Model=LLaMA-3.3-70B, Evaluation Setup=1000-sample2025.10 | 3.1 | |
| GRPOBackbone=Qwen3-4B-Base2026.05 | 2.6 | |
| Dr. GRPOBackbone=Qwen3-4B-Base2026.05 | 2.6 |