Complex Multi-step Reasoning on HLE
60Success RateEvoMAS-7
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EvoMAS-7Method Category (Single-agent vs MAS)=MAS, Candidate Pool Size=7, Workflow Layers=3, Reward Type=sparse terminal reward2026.05 | 60 | 65 | |
| G-DesignerMethod Category (Single-agent vs MAS)=MAS2026.05 | 50 | 34.8 | |
| MaASMethod Category (Single-agent vs MAS)=MAS2026.05 | 50 | 34.8 | |
| EvoMAS-4Method Category (Single-agent vs MAS)=MAS, Candidate Pool Size=4, Workflow Layers=3, Reward Type=sparse terminal reward2026.05 | 40 | 45 | |
| GPT-4oMethod Category (Single-agent vs MAS)=Single-agent2026.05 | 30 | 29.8 | |
| GPTSwarmMethod Category (Single-agent vs MAS)=MAS2026.05 | 20 | 18.3 | |
| AFlowMethod Category (Single-agent vs MAS)=MAS2026.05 | 20 | 22.1 | |
| GPT-4o-miniMethod Category (Single-agent vs MAS)=Single-agent2026.05 | 10 | 22.3 |