Mathematical Reasoning on GSM8K (Acc, Time)
92.1AccuracyGraphFlow
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GraphFlowModel=Qwen-2.5-7B2026.05 | 92.1 | 11.59 | |
| AFlowModel=Qwen-2.5-7B2026.05 | 89.2 | 12.45 | |
| GraphFlowModel=Gemma-2-9B2026.05 | 89.2 | 8.75 | |
| GraphFlowModel=Llama-3.1-8B2026.05 | 88.8 | 8.85 | |
| AgentKBModel=Qwen-2.5-7B2026.05 | 88.3 | 12.3 | |
| AutoFlowModel=Qwen-2.5-7B2026.05 | 87.5 | 14.22 | |
| TaskWeaverModel=Qwen-2.5-7B2026.05 | 86.6 | 16.84 | |
| AFlowModel=Gemma-2-9B2026.05 | 86.6 | 10.8 | |
| LLMCompilerModel=Qwen-2.5-7B2026.05 | 85.9 | 10.81 | |
| AutoFlowModel=Gemma-2-9B2026.05 | 85.8 | 11.5 | |
| LLMCompilerModel=Gemma-2-9B2026.05 | 85.5 | 8.8 | |
| AgentKBModel=Gemma-2-9B2026.05 | 85.5 | 9.35 | |
| AFlowModel=Llama-3.1-8B2026.05 | 85.4 | 10.6 | |
| MetaGPTModel=Gemma-2-9B2026.05 | 85.4 | 9.81 | |
| MetaGPTModel=Qwen-2.5-7B2026.05 | 85.3 | 9.89 | |
| TaskWeaverModel=Gemma-2-9B2026.05 | 85.2 | 14.15 | |
| AgentKBModel=Llama-3.1-8B2026.05 | 84.6 | 8.9 | |
| VanillaModel=Gemma-2-9B2026.05 | 84.4 | 4.74 | |
| AutoFlowModel=Llama-3.1-8B2026.05 | 83.5 | 12.15 | |
| TaskWeaverModel=Llama-3.1-8B2026.05 | 82.8 | 12.98 | |
| MetaGPTModel=Llama-3.1-8B2026.05 | 82.7 | 8.98 | |
| LLMCompilerModel=Llama-3.1-8B2026.05 | 82.2 | 8.92 | |
| VanillaModel=Qwen-2.5-7B2026.05 | 81.5 | 6.28 | |
| VanillaModel=Llama-3.1-8B2026.05 | 78.8 | 4.96 |