Mathematical Reasoning on HARDMath2
36.5AccuracyHermes@5+Skywork
Evaluation Results
| Method | Links | |
|---|---|---|
| Hermes@5+SkyworkModel=DeepSeek-V3.22025.11 | 36.5 | |
| Hermes@5+MajorityModel=DeepSeek-V3.22025.11 | 35.1 | |
| Hermes@1Model=DeepSeek-V3.22025.11 | 33.6 | |
| Hermes@5+MajorityModel=OpenAI o3-mini2025.11 | 31.8 | |
| Hermes@1Model=OpenAI o3-mini2025.11 | 31.3 | |
| Hermes@5+SkyworkModel=OpenAI o3-mini2025.11 | 31.3 | |
| CoT@5+SkyworkModel=DeepSeek-V3.22025.11 | 30.8 | |
| CoT@5+Safe*Model=DeepSeek-V3.22025.11 | 30.3 | |
| CoT@5+SkyworkModel=OpenAI o3-mini2025.11 | 29.4 | |
| CoT@5+SafeModel=DeepSeek-V3.22025.11 | 28.9 | |
| CoT@5+ArmoRMModel=OpenAI o3-mini2025.11 | 28.4 | |
| CoT@5+RLHFlowModel=OpenAI o3-mini2025.11 | 28.4 | |
| CoT@5+ArmoRMModel=DeepSeek-V3.22025.11 | 28.4 | |
| CoT@5+ShepherdModel=DeepSeek-V3.22025.11 | 27.8 | |
| CoT@5+SafeModel=OpenAI o3-mini2025.11 | 26.1 | |
| CoT@5+MajorityModel=DeepSeek-V3.22025.11 | 26.1 | |
| CoT@5+ShepherdModel=OpenAI o3-mini2025.11 | 25.6 | |
| CoT@5+Safe*Model=OpenAI o3-mini2025.11 | 25.6 | |
| CoT@1Model=DeepSeek-V3.22025.11 | 25.6 | |
| CoT@5+RLHFlowModel=DeepSeek-V3.22025.11 | 24.6 | |
| CoT@1Model=OpenAI o3-mini2025.11 | 23.2 | |
| CoT@5+MajorityModel=OpenAI o3-mini2025.11 | 22.7 | |
| Hermes@5+SkyworkModel=Qwen3-8B2025.11 | 10 | |
| Hermes@5+MajorityModel=Qwen3-8B2025.11 | 7.6 | |
| Hermes@1Model=Qwen3-8B2025.11 | 6.6 | |
| CoT@5+Safe*Model=Qwen3-8B2025.11 | 6.2 | |
| CoT@5+SkyworkModel=Qwen3-8B2025.11 | 5.7 | |
| CoT@5+ShepherdModel=Qwen3-8B2025.11 | 5.7 | |
| CoT@5+RLHFlowModel=Qwen3-8B2025.11 | 5.7 | |
| CoT@5+SafeModel=Qwen3-8B2025.11 | 5.7 | |
| CoT@5+ArmoRMModel=Qwen3-8B2025.11 | 5.2 | |
| CoT@5+MajorityModel=Qwen3-8B2025.11 | 4.7 | |
| CoT@1Model=Qwen3-8B2025.11 | 4.3 |