Mathematical Reasoning on MATH (Acc., Time)
94.2AccuracyNTele-R1-32B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| NTele-R1-32B2025.08 | 94.2 | — | |
| DS-32B2025.08 | 88.28 | — | |
| GraphFlowModel=Qwen-2.5-7B2026.05 | 76.4 | 15.22 | |
| AFlowModel=Qwen-2.5-7B2026.05 | 72.1 | 16.6 | |
| LLMCompilerModel=Qwen-2.5-7B2026.05 | 68.8 | 14.67 | |
| AgentKBModel=Qwen-2.5-7B2026.05 | 68.3 | 15.85 | |
| AutoFlowModel=Qwen-2.5-7B2026.05 | 68.2 | 17.95 | |
| MetaGPTModel=Qwen-2.5-7B2026.05 | 66.6 | 14.52 | |
| TaskWeaverModel=Qwen-2.5-7B2026.05 | 65.5 | 18.26 | |
| VanillaModel=Qwen-2.5-7B2026.05 | 60.4 | 9.63 | |
| GraphFlowModel=Llama-3.1-8B2026.05 | 52.6 | 15.95 | |
| AFlowModel=Llama-3.1-8B2026.05 | 47.5 | 16.4 | |
| AutoFlowModel=Llama-3.1-8B2026.05 | 46.8 | 18.1 | |
| AgentKBModel=Llama-3.1-8B2026.05 | 46.5 | 18.55 | |
| TaskWeaverModel=Llama-3.1-8B2026.05 | 45.2 | 20.22 | |
| LLMCompilerModel=Llama-3.1-8B2026.05 | 44.7 | 15.05 | |
| GraphFlowModel=Gemma-2-9B2026.05 | 42.5 | 13.1 | |
| MetaGPTModel=Llama-3.1-8B2026.05 | 42.3 | 14.68 | |
| AgentKBModel=Gemma-2-9B2026.05 | 37.5 | 15.85 | |
| AFlowModel=Gemma-2-9B2026.05 | 37.2 | 15.35 | |
| AutoFlowModel=Gemma-2-9B2026.05 | 36.9 | 16.8 | |
| VanillaModel=Llama-3.1-8B2026.05 | 36.6 | 12.58 | |
| LLMCompilerModel=Gemma-2-9B2026.05 | 35.2 | 14.35 | |
| TaskWeaverModel=Gemma-2-9B2026.05 | 34.8 | 18.5 | |
| MetaGPTModel=Gemma-2-9B2026.05 | 34.6 | 12.87 | |
| VanillaModel=Gemma-2-9B2026.05 | 30.6 | 7.99 |