Mathematical Reasoning on CollegeMATH
85.2AccuracyHermes@5+Majority
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Hermes@5+MajorityModel=DeepSeek-V3.22025.11 | 85.2 | — | — | — | |
| Hermes@5+SkyworkModel=DeepSeek-V3.22025.11 | 84 | — | — | — | |
| Hermes@1Model=DeepSeek-V3.22025.11 | 83.3 | — | — | — | |
| CoT@5+MajorityModel=DeepSeek-V3.22025.11 | 80.8 | — | — | — | |
| CoT@5+SkyworkModel=DeepSeek-V3.22025.11 | 80.4 | — | — | — | |
| CoT@5+ShepherdModel=DeepSeek-V3.22025.11 | 80.4 | — | — | — | |
| CoT@5+ArmoRMModel=DeepSeek-V3.22025.11 | 80.3 | — | — | — | |
| CoT@5+RLHFlowModel=DeepSeek-V3.22025.11 | 80.3 | — | — | — | |
| CoT@5+Safe*Model=DeepSeek-V3.22025.11 | 80.1 | — | — | — | |
| CoT@5+SafeModel=DeepSeek-V3.22025.11 | 80 | — | — | — | |
| CoT@1Model=DeepSeek-V3.22025.11 | 79.8 | — | — | — | |
| Hermes@5+MajorityModel=OpenAI o3-mini2025.11 | 79.4 | — | — | — | |
| Hermes@5+SkyworkModel=OpenAI o3-mini2025.11 | 79.2 | — | — | — | |
| Hermes@1Model=OpenAI o3-mini2025.11 | 78.9 | — | — | — | |
| Hermes@5+SkyworkModel=Qwen3-8B2025.11 | 77.4 | — | — | — | |
| CoT@5+SkyworkModel=OpenAI o3-mini2025.11 | 76.1 | — | — | — | |
| CoT@5+ArmoRMModel=OpenAI o3-mini2025.11 | 76.1 | — | — | — | |
| CoT@5+MajorityModel=OpenAI o3-mini2025.11 | 76 | — | — | — | |
| CoT@5+RLHFlowModel=OpenAI o3-mini2025.11 | 75.9 | — | — | — | |
| Hermes@5+MajorityModel=Qwen3-8B2025.11 | 75.8 | — | — | — | |
| CoT@5+Safe*Model=OpenAI o3-mini2025.11 | 75.8 | — | — | — | |
| CoT@5+ShepherdModel=OpenAI o3-mini2025.11 | 75.7 | — | — | — | |
| CoT@5+SafeModel=OpenAI o3-mini2025.11 | 75.7 | — | — | — | |
| CoT@1Model=OpenAI o3-mini2025.11 | 75.2 | — | — | — | |
| Hermes@1Model=Qwen3-8B2025.11 | 73 | — | — | — | |
| CoT@5+Safe*Model=Qwen3-8B2025.11 | 72.5 | — | — | — | |
| CoT@5+ArmoRMModel=Qwen3-8B2025.11 | 72.4 | — | — | — | |
| CoT@5+SafeModel=Qwen3-8B2025.11 | 72.4 | — | — | — | |
| CoT@5+SkyworkModel=Qwen3-8B2025.11 | 72 | — | — | — | |
| CoT@5+MajorityModel=Qwen3-8B2025.11 | 70.3 | — | — | — | |
| CoT@5+ShepherdModel=Qwen3-8B2025.11 | 70.2 | — | — | — | |
| CoT@5+RLHFlowModel=Qwen3-8B2025.11 | 69.4 | — | — | — | |
| CoT@1Model=Qwen3-8B2025.11 | 69.1 | — | — | — | |
| DAPO + HistaModel Size=14B, RL Algorithm=DAPO2026.05 | 65.3 | — | — | — | |
| DAPOModel Size=14B, RL Algorithm=DAPO2026.05 | 64.7 | — | — | — | |
| DAPO + HistaModel Size=7B, RL Algorithm=DAPO2026.05 | 64.3 | — | — | — | |
| DAPOModel Size=7B, RL Algorithm=DAPO2026.05 | 63.8 | — | — | — | |
| CSIPO + HistaModel Size=7B, RL Algorithm=CSIPO2026.05 | 62.9 | — | — | — | |
| CSIPOModel Size=7B, RL Algorithm=CSIPO2026.05 | 62.3 | — | — | — | |
| CSIPOModel Size=3B, RL Algorithm=CSIPO2026.05 | 59 | — | — | — | |
| DAPO + HistaModel Size=3B, RL Algorithm=DAPO2026.05 | 58.1 | — | — | — | |
| CSIPO + HistaModel Size=3B, RL Algorithm=CSIPO2026.05 | 57.8 | — | — | — | |
| DAPOModel Size=3B, RL Algorithm=DAPO2026.05 | 57.6 | — | — | — | |
| GRAILModel=Qwen3-8B, Sampling Temperature=0.6, Generations per problem=32026.06 | 56 | — | — | 59 | |
| GRPOModel=Qwen3-8B, Sampling Temperature=0.6, Generations per problem=32026.06 | 54 | — | — | 57 | |
| CSIPO + HistaModel Size=1.5B, RL Algorithm=CSIPO2026.05 | 53.5 | — | — | — | |
| DAPOModel Size=1.5B, RL Algorithm=DAPO2026.05 | 53.3 | — | — | — | |
| GRAILModel=Qwen3-4B, Sampling Temperature=0.6, Generations per problem=32026.06 | 53.17 | — | — | 55 | |
| GSPOModel Size=1.5B, RL Algorithm=GSPO2026.05 | 52.6 | — | — | — | |
| Pass@8 (Upper Bound)Decoding Strategy=Pass@82025.05 | 52.5 | — | — | — | |
| GSPO + HistaModel Size=1.5B, RL Algorithm=GSPO2026.05 | 52.5 | — | — | — | |
| CSIPOModel Size=1.5B, RL Algorithm=CSIPO2026.05 | 52.4 | — | — | — | |
| GRPOModel=Qwen3-4B, Sampling Temperature=0.6, Generations per problem=32026.06 | 52.17 | — | — | 55.5 | |
| DAPO + HistaModel Size=1.5B, RL Algorithm=DAPO2026.05 | 51.5 | — | — | — | |
| Qwen2-Math-7B-InstructSynthesis Model=-2024.10 | 50.5 | — | — | — | |
| GPT-4o-2024-08-06Synthesis Model=-2024.10 | 50.2 | — | — | — | |
| Qwen2-Math-7B-ScaleQuestBase Model=Qwen2-Math-7B, Synthesis Model=Qwen2-Math-7B-Instruct2024.10 | 50 | — | — | — | |
| CrossEntropyBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=CrossEntropy2026.02 | 49.3 | — | — | — | |
| SED-SFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT2026.02 | 48.8 | — | — | — | |
| GEMBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=GEM2026.02 | 48.7 | — | — | — | |
| DFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=DFT2026.02 | 48.5 | — | — | — | |
| SCOPEDecoding Strategy=Best-of-8 strategy, Training Data=automatically constructed2025.05 | 48.3 | — | — | — | |
| SCOPE (w/o AST normalization)Decoding Strategy=Best-of-8 strategy, Ablation=w/o AST normalization2025.05 | 48.3 | — | — | — | |
| SCOPE (Step Replacement)Decoding Strategy=Best-of-8 strategy, Ablation=Step Replacement2025.05 | 48.3 | — | — | — | |
| SCOPE (Step Skipping)Decoding Strategy=Best-of-8 strategy, Ablation=Step Skipping2025.05 | 48.3 | — | — | — | |
| SED-SFT w/o maskBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT w/o mask2026.02 | 48.3 | — | — | — | |
| Qwen2.5-Math-7B-PRM800KDecoding Strategy=Best-of-8 strategy, Training Data=manually annotated (PRM800K)2025.05 | 48.2 | — | — | — | |
| Skywork-PRM-1.5BDecoding Strategy=Best-of-8 strategy, Training Data=automatically constructed2025.05 | 48.1 | — | — | — | |
| SCOPE (w/o code translation)Decoding Strategy=Best-of-8 strategy, Ablation=w/o code translation2025.05 | 48 | — | — | — | |
| Skywork-PRM-7BDecoding Strategy=Best-of-8 strategy, Training Data=automatically constructed2025.05 | 47.9 | — | — | — | |
| DFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=DFT2026.02 | 47.9 | — | — | — | |
| Majority @8Decoding Strategy=Majority @82025.05 | 47.8 | — | — | — | |
| DeepSeekMath-7B-ScaleQuestBase Model=DeepSeekMath-7B, Synthesis Model=Qwen2-Math-7B-Instruct2024.10 | 47.7 | — | — | — | |
| RLHFlow-PRM-Mistral-8BDecoding Strategy=Best-of-8 strategy, Training Data=automatically constructed2025.05 | 47.6 | — | — | — | |
| RLHFlow-PRM-Deepseek-8BDecoding Strategy=Best-of-8 strategy, Training Data=automatically constructed2025.05 | 47.4 | — | — | — | |
| CoAModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=CoA, Evaluation Protocol=Zero-shot2025.06 | 47.2 | — | — | — | |
| AbstRaLModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=AbstRaL, Evaluation Protocol=Zero-shot2025.06 | 47.2 | — | — | — | |
| Ori-SFTModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=Ori-SFT, Evaluation Protocol=Zero-shot2025.06 | 47.1 | — | — | — | |
| CoT-RLModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=CoT-RL, Evaluation Protocol=Zero-shot2025.06 | 46.8 | — | — | — | |
| GreedyDecoding Strategy=Greedy2025.05 | 46.3 | — | — | — | |
| CAPO (GRPO)Backbone=Qwen2.5-7B-Math2025.12 | 46.3 | — | — | — | |
| Math-Shepherd-PRM-7BDecoding Strategy=Best-of-8 strategy, Training Data=automatically constructed2025.05 | 45.5 | — | — | — | |
| Qwen2-Math-7B-Numina-MathBase Model=Qwen2-Math-7B, Synthesis Model=GPT-4o2024.10 | 45.5 | — | — | — | |
| Qwen2-Math-7B-DART-MathBase Model=Qwen2-Math-7B, Synthesis Model=DSMath-7B-RL2024.10 | 45.4 | — | — | — | |
| GRPOBackbone=Qwen2.5-7B-Math2025.12 | 44.8 | — | — | — | |
| Mistral-7B-ScaleQuestBase Model=Mistral-7B, Synthesis Model=Qwen2-Math-7B-Instruct2024.10 | 43.5 | — | — | — | |
| Llama3-8B-ScaleQuestBase Model=Llama3-8B, Synthesis Model=Qwen2-Math-7B-Instruct2024.10 | 42.8 | — | — | — | |
| CoTBackbone=Qwen2.5-7B-Math2025.12 | 42.7 | — | — | — | |
| CAPO (Reinforce++)Backbone=Qwen2.5-7B-Math2025.12 | 42.5 | — | — | — | |
| GRPOModel=R1-Distill-Llama-8B, Sampling Temperature=0.6, Generations per problem=32026.06 | 42.5 | — | — | 50 | |
| CAPO (Reinforce++)Backbone=Qwen2.5-1.5B-Math2025.12 | 42 | — | — | — | |
| DeepSeekMath-7B-RFTBase Model=DeepSeekMath-7B, # Samples=590K2025.03 | 41.9 | — | — | — | |
| TIES-MergingModel Scale=7B, Decoding Strategy=Greedy2026.03 | 41.9 | — | — | — | |
| CAPO (RLOO)Backbone=Qwen2.5-1.5B-Math2025.12 | 41.8 | — | — | — | |
| CAPO (PPO)Backbone=Qwen2.5-7B-Math2025.12 | 41.7 | — | — | — | |
| CAPO (GRPO)Backbone=Qwen2.5-1.5B-Math2025.12 | 41.7 | — | — | — | |
| GRAILModel=R1-Distill-Llama-8B, Sampling Temperature=0.6, Generations per problem=32026.06 | 41.67 | — | — | 49.5 | |
| DeepSeekMath-7B-RLSynthesis Model=-2024.10 | 41.4 | — | — | — | |
| RLOOBackbone=Qwen2.5-1.5B-Math2025.12 | 41.4 | — | — | — | |
| DeepSeekMath-7B-RLTraining Method=RL, Backbone=DeepSeekMath-7B2024.06 | 41.3 | — | — | — |