Mathematical Reasoning on MATH (Performance and Cost Metrics)
69.34AccuracyFlowBank
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| FlowBankExecutor LLM=GPT-4o mini, Optimizer LLM=Qwen3-8B2026.06 | 69.34 | 1.78 | |
| MaASExecutor LLM=GPT-4o mini2026.06 | 65.02 | 2.43 | |
| AFlow (GPT-4o)Executor LLM=GPT-4o mini, Optimizer LLM=GPT-4o2026.06 | 63.99 | 2.77 | |
| AFlow (Qwen3-8B)Executor LLM=GPT-4o mini, Optimizer LLM=Qwen3-8B2026.06 | 63.24 | 3.23 | |
| AgentSquareExecutor LLM=GPT-4o mini, Optimizer LLM=GPT-4o2026.06 | 62.76 | 1.35 | |
| ScoreFlowExecutor LLM=GPT-4o mini, Generator LLM=Qwen3-8B2026.06 | 62 | 2.36 | |
| Multi-agent DebateExecutor LLM=GPT-4o mini2026.06 | 58.92 | 7.66 | |
| Self-ConsistencyExecutor LLM=GPT-4o mini2026.06 | 57.82 | 3.38 | |
| MultiPersonaExecutor LLM=GPT-4o mini2026.06 | 57.41 | 0.56 | |
| MedPromptExecutor LLM=GPT-4o mini2026.06 | 56.69 | 5.64 | |
| IOExecutor LLM=GPT-4o mini2026.06 | 56.58 | 0.51 | |
| ADASExecutor LLM=GPT-4o mini, Optimizer LLM=GPT-4o2026.06 | 56.17 | 2.95 | |
| CoTExecutor LLM=GPT-4o mini2026.06 | 55.76 | 0.53 | |
| Self-RefineExecutor LLM=GPT-4o mini2026.06 | 55.14 | 1.08 | |
| GPTSwarmExecutor LLM=GPT-4o mini2026.06 | 54.94 | 1.69 | |
| ComplexCoTExecutor LLM=GPT-4o mini2026.06 | 54.39 | 0.62 |