Aggregated Multi-task Evaluation on Average
73.4Performance ScoreFlowBank
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| FlowBankExecutor LLM=GPT-4o mini, Optimizer LLM=Qwen3-8B2026.06 | 73.4 | 1.65 | |
| AFlow (GPT-4o)Executor LLM=GPT-4o mini, Optimizer LLM=GPT-4o2026.06 | 70.4 | 1.95 | |
| ScoreFlowExecutor LLM=GPT-4o mini, Generator LLM=Qwen3-8B2026.06 | 69.51 | 2.37 | |
| AFlow (Qwen3-8B)Executor LLM=GPT-4o mini, Optimizer LLM=Qwen3-8B2026.06 | 68.56 | 1.79 | |
| MaASExecutor LLM=GPT-4o mini2026.06 | 68.09 | 1.9 | |
| AgentSquareExecutor LLM=GPT-4o mini, Optimizer LLM=GPT-4o2026.06 | 66.7 | 1.02 | |
| MultiPersonaExecutor LLM=GPT-4o mini2026.06 | 63.87 | 0.41 | |
| Multi-agent DebateExecutor LLM=GPT-4o mini2026.06 | 63.86 | 3.45 | |
| ComplexCoTExecutor LLM=GPT-4o mini2026.06 | 63.85 | 0.42 | |
| GPTSwarmExecutor LLM=GPT-4o mini2026.06 | 63.43 | 2.54 | |
| ADASExecutor LLM=GPT-4o mini, Optimizer LLM=GPT-4o2026.06 | 63.22 | 1.71 | |
| MedPromptExecutor LLM=GPT-4o mini2026.06 | 62.77 | 2.58 | |
| Self-ConsistencyExecutor LLM=GPT-4o mini2026.06 | 61.49 | 1.51 | |
| CoTExecutor LLM=GPT-4o mini2026.06 | 60.98 | 0.23 | |
| IOExecutor LLM=GPT-4o mini2026.06 | 60.44 | 0.22 | |
| Self-RefineExecutor LLM=GPT-4o mini2026.06 | 57.96 | 0.62 |